Kog optimiza el rendimiento de GPUs para maximizar la inferencia en proyectos tecnológicos

Kog optimiza el rendimiento de GPUs para maximizar la inferencia en proyectos tecnológicos

El vertiginoso avance en la inteligencia artificial ha desatado una carrera por optimizar la velocidad de inferencia, y en este contexto, la startup francesa Kog se presenta como un jugador innovador. Con una propuesta audaz, Kog está convencida de que se puede extraer un rendimiento notable de las GPUs convencionales, en lugar de depender únicamente de chips diseñados específicamente para esta tarea. Esta visión fue destacada durante su reciente demostración, que captó la atención del ecosistema tecnológico.

En mayo, Kog logró atraer a un amplio público en Hacker News al presentar un avance técnico que demuestra que es posible lograr una decodificación extremadamente rápida en GPUs estándar, como las AMD MI300X y Nvidia H200. A pesar de que algunos observaron que esta rapidez no se extendería a las GPUs de laptops, otros vieron en esta innovadora solución un gran potencial. Con la velocidad de inferencia y los costos como factores críticos en la actualidad, la capacidad de Kog para desbloquear nuevas funcionalidades en hardware ya existente ha despertado el interés de muchos en la industria. Según su CEO, Gaël Delalleau, la empresa ha registrado 200 contactos comerciales significativos desde su lanzamiento.

Kog tiene como objetivo primordial satisfacer la demanda de usuarios que, fallidos por las largas esperas en la obtención de resultados, recurren a flujos de trabajo de inteligencia artificial para tareas profesionales. Además, colabora con socios de diseño que permiten a los usuarios generar juegos y aplicaciones de manera más eficiente, lo que podría traducirse en mayores ingresos al emplear el Kog Inference Engine (KIE).

A pesar de su prometedora propuesta, Kog reconoce que el mercado aún no está del todo maduro. La compañía ha notado que muchos de sus clientes potenciales no están dispuestos a afinar modelos pequeños, lo que ha llevado a la startup a enfocarse en acelerar el desarrollo de modelos más grandes que puedan satisfacer las demandas del mercado.

La ambición de Kog: 30x más rápida en la inferencia de LLMs

Los primeros resultados son alentadores, con una demostración que logró procesar 3,000 tokens por segundo en un modelo optimizado de 2,000 millones de parámetros llamado Laneformer 2B. Sin embargo, la verdadera prueba de fuego radica en la capacidad para aplicar este enfoque a modelos de lenguaje de mayor tamaño (LLMs). Delalleau se mantiene optimista, afirmando que la idea de que las GPUs no son adecuadas para la decodificación es un mito. Asegura que las GPUs modernas cuentan con una mayor capacidad de ancho de banda de memoria que está esperando ser aprovechada.

Kog no es la única en explorar las posibilidades de optimización de software para aumentar el rendimiento de las GPUs. La competencia en este ámbito se intensifica, con empresas como ZML que ofrecen soluciones de software agnósticas en hardware. No obstante, Kog se distingue por su enfoque más intensivo, similar al del laboratorio Hazy Research de la Universidad de Stanford, centrándose en la aceleración profunda de GPUs.

Con un equipo reducido de 11 personas, Kog admite que el enfoque detallado y el trabajo minucioso pueden hacer que la investigación y el desarrollo sean lentos. Cada nuevo modelo de GPU requiere semanas o incluso meses de estudio exhaustivo para optimizar su rendimiento, lo que limita el número de chips que la empresa puede gestionar a corto plazo.

En el horizonte, Kog espera implementar metodologías que permitan el funcionamiento en paralelo de más chips y modelos. Esto podría ser vital, especialmente en un momento en que Europa busca desarrollar su propia capacidad en el ámbito de la inteligencia artificial y la optimización tecnológica. La startup ya cuenta con el respaldo de Scaleway y está alineada con iniciativas de desarrollo tecnológico como el programa francés French Tech 2030.

Para Kog, el desafío inmediato será demostrar que su enfoque es efectivo en el ámbito de los LLMs. Esta validación no solo es fundamental para asegurar financiamiento adicional, sino que también es clave para la expansión del negocio. Delalleau ha anticipado que esperan mostrar su primer modelo principal con un incremento de velocidad de 10x para septiembre, un hito que podría catalizar el interés de inversores y potenciar su trayectoria en el competitivo mercado de la inteligencia artificial.