La llegada de modelos de inteligencia artificial a la creación visual ha marcado un hito en la tecnología y el emprendimiento. Recientemente, se ha desarrollado un «campo de dibujo» donde estos modelos, entre los que se incluyen GPT-5.6 Sol, Claude Fable 5, Grok 4.5 y Gemini 3.6 Flash, exploraron su capacidad artística mediante la creación de obras basadas en imágenes icónicas y prompts descriptivos. A través de un sistema que permite al modelo seleccionar colores, presiones y metodologías de dibujo, se llevaron a cabo un total de 28 creaciones artísticas, lo que plantea interrogantes sobre la calidad, coste y eficiencia de cada modelo.
Contexto del estudio
La elección de realizar estas pruebas se fundamenta en la búsqueda de respuestas sobre la creatividad y la habilidad artística de los modelos, más allá de resultados objecivos y cifras. Este tipo de investigaciones están diseñadas para ser informativas y proporcionar un marco de discusión sobre la brecha existente entre los modelos «de frontera» y aquellos con acceso libre. Se encontró que algunas versiones de código abierto ofrecen precios más competitivos, pero con limitadas capacidades. Este contraste se hace evidente en la ejecución de tareas de dibujo, donde ciertos modelos no logran presentar resultados válidos, incluso regresando lienzos en blanco.
Metodología y herramientas utilizadas
Los modelos utilizaron un conjunto de herramientas de dibujo uniforme que incluía la capacidad de planificar, dibujar y, posteriormente, revisar sus propias creaciones. Cada modelo realizó un número específico de pasos en función de su estrategia, lo que generó variaciones significativas en la calidad del output y los costos asociados. Algunos se concentraron en revisiones constantes de sus obras, mientras que otros adoptaron una estrategia más sencilla al ejecutar el dibujo.
Resultados de las reproducciones de obras icónicas
Los modelos enfrentaron dos desafíos principales: reproducir la Mona Lisa y La noche estrellada de Van Gogh. Se midió el grado de similitud estructural utilizando el Índice de Similaridad Estructural (SSIM). La puntuación promedio del SSIM mostró que, aunque algunos modelos alcanzaron altas puntuaciones, otros experimentaron un declive en sus resultados a medida que realizaban múltiples revisiones de su obra, lo que generó frustraciones similares a las vividas en tareas anteriores.
Costos y eficiencia en la producción
Los costos estimados para la generación de estas obras variaron drásticamente entre los modelos. Claude Fable 5, por ejemplo, resultó ser el más caro, con un coste de aproximadamente 160 dólares por las siete obras realizadas, en contraposición a los más accesibles 7.74 dólares de GPT-5.6 Sol. A pesar de alcanzar buenos resultados en términos de calidad, los costos y el tiempo empleados no fueron los más competitivos ni eficientes.
Análisis de mejoras y eficacia
Un análisis de las mejoras a lo largo de las generadas reveló que muchos modelos alcanzaron un pico inicial en la calidad de su trabajo solo para luego caer en puntuaciones más bajas. Por ejemplo, el modelo GPT-5.6 Sol mostró un rendimiento decreciente en sus últimas revisiones, lo que sugiere que el exceso de correcciones puede afectar negativamente el resultado final. Este hallazgo plantea preguntas sobre la eficiencia de los procesos de revisión y su impacto en la autocrítica de las creaciones generadas.
Conclusiones finales
Los resultados han dejado claro que, aunque la tecnología avanza a pasos agigantados, aún hay un largo camino por recorrer en el ámbito artístico para estos modelos. GPT-5.6 Sol se destaca como un líder en calidad y eficiencia, mientras que Grok 4.5 ha demostrado ser poco confiable en sus salidas creativas. A medida que la comunidad de inteligencia artificial continúa buscando mejoras y optimización de costos, la discusión sobre la creatividad y capacidad artística en tecnología sigue siendo un tema candente y relevante en el mundo empresarial y tecnológico.
