Saltar al contenido
Xavi Creus

IA

Transformer

Un transformer es la arquitectura de red neuronal, basada en el mecanismo de atención, que hace posibles los modelos de lenguaje grandes actuales.

Definición

Un transformer es una arquitectura de red neuronal presentada por Google en 2017 que procesa secuencias completas de datos en paralelo gracias a un mecanismo llamado atención. La atención permite que cada palabra mire a todas las demás de la frase y decida cuáles son relevantes para entenderla. Esa idea resolvió el gran problema de las arquitecturas anteriores, que leían palabra a palabra y olvidaban el principio de los textos largos.

Casi todos los modelos de IA que una empresa usa hoy son transformers: los modelos de lenguaje grandes, los traductores, los generadores de imágenes y los sistemas de reconocimiento de voz. Nadie en una empresa normal implementa un transformer; se accede a él a través de un producto o una API. Pero conocer el término ayuda a entender por qué los modelos actuales mejoran tanto con más datos y más cómputo.

La T de GPT significa transformer. Desde 2017 la arquitectura ha evolucionado con variantes más eficientes, pero la idea central sigue siendo la misma. El malentendido habitual es pensar que el transformer entiende el lenguaje como nosotros. Lo que hace es calcular relaciones estadísticas entre tokens con una precisión extraordinaria. Su coste de cómputo crece con la longitud del texto, lo que explica los límites de la ventana de contexto.

En la práctica

Un despacho de abogados usa un modelo basado en transformer para revisar contratos de 200 páginas. La arquitectura le permite relacionar una cláusula de la página 3 con una excepción de la página 180, algo que los sistemas anteriores no podían hacer.

Por qué importa

No necesitas saber cómo funciona un transformer, igual que no necesitas saber cómo funciona un motor. Pero sí te interesa saber que toda la IA actual descansa sobre una única arquitectura y que sus límites, coste y contexto, son los límites de esa arquitectura.

Preguntas frecuentes

¿Qué es un transformer en inteligencia artificial?
Es el diseño de red neuronal que usan los modelos de lenguaje actuales. Su novedad es el mecanismo de atención, que permite procesar todo un texto a la vez y relacionar cualquier palabra con cualquier otra. Lo presentó Google en 2017 en el artículo "Attention Is All You Need".
¿Por qué los transformers han sido tan importantes para la IA?
Porque escalan: cuanto más grandes son y más datos reciben, mejores resultados dan, de forma bastante predecible. Además se entrenan en paralelo en miles de GPU. Esa combinación permitió pasar de sistemas que hacían una tarea a modelos generales que escriben, programan y razonan.

¿Necesitas que te lo explique para tu empresa?

Una hora conmigo suele bastar para convertir el vocabulario en una decisión.

Reservar una sesión