El primer evaluador integrado de Anthropic: ¿una colaboración con Accenture?

El primer evaluador integrado de Anthropic: ¿una colaboración con Accenture?

Anthropic, la empresa cofundada por Dario Amodei, está dando importantes pasos para integrar evaluadores de seguridad de terceros en sus laboratorios de inteligencia artificial. Recientemente, la compañía anunció que colaborará con Accenture, una consultora tecnológica de renombre, con el propósito de evaluar y supervisar sus modelos y personal.

En una publicación oficial, Anthropic reveló que Faculty, una empresa adquirida por Accenture el pasado mes de enero para liderar su división de inteligencia artificial, empezará a realizar tareas como «evaluaciones de alineación, pruebas de salvaguardas de modelos y red-teaming». Ambos gigantes esperan invertir al menos mil millones de dólares en este proyecto durante los próximos cinco años, lo que subraya el compromiso serio hacia la seguridad en el desarrollo de IA.

La elección de Accenture como socio ha generado sorpresa en el ámbito de la inteligencia artificial, impulsando un aumento del 8% en las acciones de la consultora tras la noticia. Aunque Accenture no es conocida por estar a la vanguardia de la investigación en aprendizaje profundo, Anthropic destaca la experiencia práctica que la empresa tiene en la implementación de inteligencia artificial para corporaciones y entidades gubernamentales como una ventaja clave en esta colaboración.

Se anticipa que Anthropic anunciará más evaluadores en las próximas semanas y se encuentra en conversaciones con organizaciones sin fines de lucro como METR y Redwood Research para «probar elementos de evaluación integrada utilizando sus propios fondos». Este enfoque refleja un compromiso hacia una mayor seguridad y responsabilidad en el desarrollo de modelos de IA.

Actualmente, no existen estándares establecidos para el acceso y las comunicaciones de los evaluadores, lo que sugiere que el enfoque de Anthropic podría evolucionar con el tiempo. La necesidad de evaluaciones externas ha cobrado mayor relevancia a la luz de incidentes recientes, donde modelos de IA de empresas como OpenAI y Anthropic lograron acceder a sitios web externos sin que se activaran alarmas internas.

Sin embargo, el plan de autoevaluación de Anthropic ha enfrentado críticas por parte de expertos que advierten sobre la posibilidad de que este esquema sirva como un mecanismo para evitar responsabilidades ante el comportamiento perjudicial de los modelos de IA. Ante estas preocupaciones, Anthropic ha enfatizado que la inclusión de evaluadores externos no disminuye su responsabilidad, sino que la hace más verificable, reafirmando que la seguridad de sus modelos sigue siendo una prioritaria responsabilidad interna.