IA · Verificado por ViaMind
EleutherAI propone filtrar datos de preentrenamiento para blindar modelos abiertos
La organización publica Deep Ignorance, un método que elimina conocimiento inseguro durante el preentrenamiento y, según sus autores, mantiene el rendimiento general y resiste manipulaciones.
Fuente: EleutherAI · Ver original ↗
Lo reportado
El anuncio
Según EleutherAI, el 12 de agosto de 2025 publicó el artículo 'Pretraining Data Filtering for Open-Weight AI Safety', firmado por Kyle O'Brien, Stella Biderman, Aviya Skowron y Quentin Anthony. El trabajo presenta Deep Ignorance, una técnica que filtra datos de preentrenamiento para construir salvaguardas resistentes a la manipulación en modelos de pesos abiertos.
El problema que aborda
EleutherAI sostiene que las salvaguardas actuales, como el entrenamiento de rechazo y los filtros de entrada, son frágiles ante jailbreaks y solo funcionan en contextos controlados por API. En modelos de pesos abiertos, donde el usuario tiene acceso directo, estas intervenciones posteriores resultan insuficientes.
La propuesta
La técnica Deep Ignorance filtra el corpus de preentrenamiento para evitar que el modelo adquiera conocimiento inseguro desde el inicio. Según los autores, esto no sacrifica el rendimiento general y produce modelos resistentes a intentos de eliminar o alterar las salvaguardas.
Estado de evidencia: Las afirmaciones materiales incluidas fueron contrastadas con la evidencia enlazada.
Qué seguir
La publicación del paper completo de Deep Ignorance con evaluaciones independientes y código reproducible permitirá verificar las afirmaciones de rendimiento y resistencia.
Compartir esta historia
RECIBE VIAMIND RADAR
Lo que importa,
directo en tu correo.
Un resumen diario con una historia clave de cada sección.


