Goodfire presenta monitores 'inside-out' que detectan agentes de IA no autorizados a un costo reducido.

Goodfire presenta monitores ‘inside-out’ que detectan agentes de IA no autorizados a un costo reducido.

En medio de un panorama de creciente preocupación por la seguridad y el comportamiento de los modelos de inteligencia artificial, la startup Goodfire ha presentado una solución innovadora y más económica para el monitoreo de estos sistemas. La propuesta, lanzada recientemente, consiste en una serie de monitores que analizan los procesos internos de un modelo de IA mientras este opera, lo que permite una supervisión más efectiva sin incurrir en los altos costos asociados con las metodologías tradicionales.

Tradicionalmente, el monitoreo de modelos de IA implica la utilización de un segundo agente de IA que revisión constantemente lo que el primero produce. Sin embargo, este enfoque puede resultar prohibitivamente caro, especialmente cuando los modelos están activos durante largos periodos y manejan volúmenes considerables de datos. La solución de Goodfire, en cambio, permite a los usuarios de Baseten, una plataforma que gestiona modelos de IA, obtener un monitoreo más eficiente y rentable.

La Estrategia de Monitoreo de Goodfire

El sistema de Goodfire se asemeja a los controles de seguridad en un aeropuerto. Utiliza pequeños detectores, denominados «probes», que interceptan las señales internas del modelo en cada etapa de su funcionamiento. Este enfoque reduce costos y tiempo, ya que evita que un modelo adicional tenga que leer y procesar todas las operaciones del modelo monitorizado. Según Eric Ho, CEO de Goodfire, este método es «realmente barato porque reutiliza los cálculos en el paso hacia adelante»; los probes simplemente analizan resultados ya generados por el modelo.

Las pruebas realizadas con Kimi K3, un modelo de IA en el que Goodfire ha basado su primer monitor, indican que monitorear aproximadamente 1,500 sesiones cuesta alrededor de 51 dólares, en comparación con los 233 dólares por un modelo más barato que revisa cada paso y los hasta 10,000 dólares por modelos de mayor rango. Durante estas pruebas, los probes atraparon el 94% de las sesiones maliciosas y enviaron el 8.7% de las inofensivas para una revisión más profunda.

De acuerdo con Dan Balsam, CTO y cofundador de Goodfire, «la gran ventaja es que puedes detectar problemas antes de que ocurran». Este enfoque proactivo permite anticiparse a comportamientos indeseados durante las evaluaciones o entrenamientos de los modelos.

Desafíos en el Monitoreo de Modelos Abiertos

La propuesta de Goodfire tiene particular relevancia para los modelos abiertos. Estos sistemas permiten que los desarrolladores los descarguen y eliminen sus salvaguardias, a menudo careciendo del monitoreo robusto que los laboratorios cerrados implementan. Según Balsam, «el daño que un individuo puede hacer con un modelo abierto es menor en comparación con lo que podría generar alguien con clusters de computación, como los proveedores de inferencia». Esto subraya la necesidad de implementar guardrails durante la inferencia para mitigar los riesgos asociados.

Investigaciones recientes de Goodfire señalaron que modelos de IA abiertos, como Kimi K3 y GLM 5.2, presentan tasas de «reward-hacking» que oscilan entre el 50% y el 96% en pruebas de comportamiento. Esto indica un potencial serio para el uso indebido si no se administran adecuadamente.

Si bien Goodfire no es la primera empresa en adoptar un enfoque de monitoreo interno, su sistema representa un avance importante. Google DeepMind ha explorado metodologías similares en su proyecto Gemini. A largo plazo, Goodfire también busca reverse-engineering de los modelos de lenguaje para poder rastrear comportamientos hasta las fases de entrenamiento, transformando la «magia» del aprendizaje automático en una ingeniería de precisión, según Balsam.