Desarrollo de una arquitectura de IA personalizada en Rust: Sparticle62ops/pssa disponible en GitHub.

Desarrollo de una arquitectura de IA personalizada en Rust: Sparticle62ops/pssa disponible en GitHub.

En el mundo de la inteligencia artificial y el procesamiento del lenguaje natural, surge una nueva propuesta que desafía las bases establecidas por los modelos de aprendizaje profundo. Se trata de PSSA, un modelo lingüístico que opera bajo un enfoque distinto, prescindiendo de las arquitecturas de transformadores que han dominado el campo en los últimos años.

PSSA, desarrollado completamente en Rust, no utiliza ninguna de las plataformas de machine learning populares como PyTorch o TensorFlow. A través de una capa recurrente de espacio de estado, este modelo procesa texto un token a la vez, construyendo y utilizando un banco de memorias episódicas para buscar información y ajustar sus propios pesos en tiempo real. Esta estrategia le permite aprender más rápido y generar texto de manera significativamente más rápida que sus predecesores basados en transformadores.

Las pruebas realizadas muestran que PSSA no solo es más eficiente en términos de velocidad y tiempo de aprendizaje, sino que también logra una menor entropía cruzada durante el entrenamiento. Con un corpus de 12.7 millones de tokens de WikiText-103, el modelo alcanzó una entropía de entrenamiento de 3.98, mejorando considerablemente el resultado obtenido por un transformador estándar, que finalizó en 4.43. Esta diferencia implica una capacidad superior de generalización, lo que significa que PSSA no solo memoriza, sino que también aprende a generalizar patrones en el texto.

Un enfoque innovador en la arquitectura de modelos

Una de las diferencias clave de PSSA se basa en su mecanismo de funcionamiento. Mientras que los transformadores necesitan leer todo el contexto a cada paso, lo que incrementa exponencialmente el costo computacional con la longitud de la secuencia, PSSA gestiona un estado de tamaño fijo a lo largo de la secuencia, lo que le permite mantener los costos lineales. Esto se traduce en una velocidad de generación de texto que puede ser hasta 12 veces más rápida que la de un transformador en la misma configuración de hardware.

Al ejecutar una comparación directa en un mismo entorno de CPU, PSSA completó la generación de 200 tokens en solo 226 ms, en contraste con los 2,735 ms que requirió el modelo de transformador. Esta diferencia en velocidad plantea preguntas sobre la viabilidad de modelos de lenguaje más complejos, especialmente cuando el tiempo y los recursos son factores críticos.

Calidad versus velocidad: un dilema persistente

A pesar de la destacada eficiencia de PSSA, es relevante señalar que la calidad del texto generado, en esta fase de desarrollo, no está al nivel de otros modelos más consolidados en el campo. Ambos, PSSA y el transformador, generaron texto con errores significativos y construcciones poco coherentes, pero el enfoque aquí se centra en la velocidad y la capacidad de aprendizaje, no en la fluidez del texto producido.

Además, el modelo no solo es rápido en su ejecución, sino que también presenta un enfoque único hacia la memoria y el aprendizaje. Utiliza una memoria episódica con 512 ranuras, permitiendo la capacidad de buscar y almacenar información de forma efectiva durante su funcionamiento. Este sistema de memorización, sumado a un mecanismo de ajustes plásticos en los pesos, optimiza el modelo para adaptarse a la nueva información sin perder lo que ya ha aprendido.

El desarrollo de PSSA se presenta como un interesante avance en el sector de la inteligencia artificial, ofreciendo un nuevo paradigma que podría redefinir las aproximaciones a la generación de texto y el procesamiento de lenguaje natural. A medida que el proyecto continúa evolucionando, queda por ver si su enfoque innovador podrá competir contra las arquitecturas más establecidas y si logrará mejorar la calidad del texto generado en las futuras iteraciones.