En el contexto actual de innovación tecnológica, pocas empresas enfrentan desafíos tan complejos al implementar inteligencia artificial como Waymo, la compañía de vehículos autónomos perteneciente a Alphabet y escindida de Google. No se trata solamente de ejecutar algoritmos que generan texto o automatizan procesos administrativos; Waymo se enfrenta a la tarea crítica de desarrollar sistemas que ayudan a los vehículos a navegar por calles impredecibles, interactuar con otros conductores humanos y tomar decisiones en tiempo real en un entorno físico.
Para gestionar los riesgos asociados a esta tecnología, Waymo ha establecido un modelo que podría servir de referencia para diversas industrias que buscan integrar agentes de inteligencia artificial en sus operaciones. Manasi Joshi, directora de ingeniería de sistemas de inteligencia y aprendizaje automático de Waymo, explicó en un evento reciente cómo la empresa entrena, prueba y despliega sus sistemas de IA a gran escala.
Desde su inicio, Waymo ha acumulado más de 220 millones de millas completamente autónomas, logrando una tasa de lesiones graves en accidentes 17 veces menor que la de conductores humanos en el mismo recorrido. Esto ha sido posible gracias a la adopción de lo que Joshi denomina «desarrollo centrado en la evaluación», donde la evaluación se integra en el proceso de ingeniería, en lugar de ser una mera comprobación final antes de la implementación.
Evaluaciones continuas post-lanzamiento
Joshi destacó que gran parte del esfuerzo de calidad de Waymo se ha desplazado hacia las evaluaciones. Esto incluye pruebas realizadas durante y después del entrenamiento, así como simulaciones en bucle abierto y cerrado. Según ella, la evaluación no debe ser una tarea única antes del lanzamiento; debe ser un proceso continuo que abarque la conducción, la simulación y la validación.
Este enfoque implica que las empresas deben continuar evaluando sus sistemas incluso después de su lanzamiento, ya que los modelos subyacentes, los procesos comerciales y el comportamiento del usuario están en constante cambio. Además, estas evaluaciones deben conectarse a resultados comerciales reales, en lugar de depender únicamente de métricas generales de la industria.
Probando escenarios raros y peligrosos
La jerarquía de evaluación de Waymo tiene como objetivo primordial la seguridad. Utilizan registros de conducción propios, datos de terceros y simulaciones realistas para exponer sus sistemas a diversos escenarios. Los encargados de las tareas seleccionan datos especializados y métricas para situaciones complejas que involucran usuarios vulnerables, cruces ferroviarios y zonas de construcción.
Esta filosofía también es aplicable en otros sectores. Las empresas necesitan probar no solo los casos rutinarios que sus agentes manejan con éxito, sino también situaciones inusuales que podrían provocar daños financieros, legales, de seguridad o reputacionales.
Es importante mencionar que Waymo no delega completamente las decisiones de lanzamiento a sistemas automatizados. Las revisiones de preparación para la producción incluyen una supervisión humana exhaustiva, donde líderes de seguridad internos aprueban lanzamientos de software y expansiones de áreas de servicio.
Eficiencia sin comprometer la fiabilidad
Waymo enfrenta otro desafío presente en muchos equipos de IA empresarial: la creciente demanda de capacidad informática, almacenamiento y red supera los recursos disponibles. La compañía busca eficiencia en la extracción y almacenamiento de datos, el entrenamiento distribuido de modelos y la evaluación.
Desde 2017, Waymo ha incorporado transformadores y ha expandido su uso a modelos de lenguaje, modelos de visión-lenguaje y modelos de visión-lenguaje-acción, llegando a utilizar modelos generativos multimodales en su estrategia de modelo fundamental.
La tecnología de Waymo se divide entre sistemas a bordo de los vehículos y una infraestructura fuera de ellos destinada al desarrollo de modelos y al procesamiento de datos. Esta combinación obliga a la empresa a optimizar tanto la inferencia en tiempo real como los grandes sistemas que la soportan.
Los agentes también necesitan evaluaciones
Waymo utiliza agentes de IA internamente como herramientas para aumentar la productividad de sus ingenieros. Estos agentes ayudan a analizar distribuciones de datos y priorizar problemas en la telemetría del vehículo, así como en los entrenamientos y las evaluaciones fallidas. Sin embargo, también es esencial evaluar estos agentes para garantizar que proporcionen resultados confiables y precisos.
El principal aprendizaje para los líderes empresariales es que la integración de inteligencia artificial requiere más que la selección de un modelo potente. Es crucial tener un objetivo claramente definido, datos de evaluación representativos, pruebas continuas y un sistema de infraestructura eficaz. Además, es fundamental que existan responsables humanos que mantengan la rendición de cuentas sobre el despliegue.
