La Inteligencia Artificial enfrenta desafíos en sus evaluaciones de rendimiento

La Inteligencia Artificial enfrenta desafíos en sus evaluaciones de rendimiento

Casi una de cada tres evaluaciones de sistemas de inteligencia artificial en sectores regulados en España revela problemas de fiabilidad, según un estudio de Galtea, dedicado a la evaluación de tecnologías en estas industrias. Este informe, que analiza 1,2 millones de evaluaciones realizadas entre enero y agosto de 2026, arroja una tasa de fallo general del 30,5%, señalando la urgente necesidad de mejorar los procesos de control de calidad en la implementación de la inteligencia artificial.

Los datos más sorprendentes provienen de los agentes de inteligencia artificial, sistemas diseñados para tomar decisiones de manera autónoma. Estos presentan una alarmante tasa de fallo del 46%, la más elevada de todas las categorías analizadas. Este tipo de tecnología es seguida por los sistemas de generación aumentada (RAG), con un 42%, mientras que otras aplicaciones como chatbots y procesamiento documental reportan índices de fallo significativamente más bajos.

Jorge Palomar, CEO y cofundador de Galtea, subraya que los sistemas agénticos no son deterministas, lo que significa que pueden generar resultados diferentes basándose en variaciones mínimas en las consultas que reciben. «A día de hoy, estos modelos no manejan con eficacia algunas tareas básicas del mundo empresarial,» explica Palomar, enfatizando que implementar agentes de IA sin evaluaciones minuciosas representa un riesgo considerable para las empresas.

Uno de los aspectos críticos que destaca Palomar es la gravedad de los fallos. Por ejemplo, un asistente bancario podría ofrecer información correcta sobre un producto pero omitir detalles cruciales que impidan a un cliente acceder a él, resultando en un error significativo que podría llevar a confusión. Este tipo de fallos, aunque no impliquen que el sistema completo sea inherentemente inseguro, son muy preocupantes en un entorno regulado.

Los sectores más afectados

El análisis también identifica que los sectores público y de sanidad muestran tasas de falla del 31,6% y 29,3% respectivamente, cifras que casi duplican las del sector transporte (17,4%) y servicios financieros (16%). Sin embargo, Palomar advierte que una alta tasa de fallos no implica automáticamente que un sector sea menos seguro desde el punto de vista de la inteligencia artificial.

Otro hallazgo relevante es que el 69% de los productos analizados utilizan múltiples modelos de lenguaje, lo que incrementa el riesgo de fallo debido a la interacción entre ellos. «Si un error ocurre en una etapa inicial, puede propagarse a lo largo del proceso sin ser detectado,» indica Palomar, sugiriendo que las empresas deben evaluar no solo cada modelo de forma aislada, sino también el flujo de trabajo completo para garantizar la calidad del sistema en su totalidad.

Palomar concluye planteando una cuestión vital para las empresas: “¿Cuentan con los mecanismos de gobierno y controles de calidad y seguridad necesarios para detectar y eliminar estas vulnerabilidades antes de que afecten a pacientes, clientes o ciudadanos?” Este desafío debe ser abordado con urgencia ante el creciente uso de la inteligencia artificial en ámbitos regulados.