Saltar al contenido
Xavi Creus

IA

Cómo elegir un modelo de IA: frontera, pesos abiertos o local

Elige el modelo de IA por tarea: frontera para el criterio, gama media para el volumen, pesos abiertos o local para privacidad y residencia UE. Precios.

Por Xavi Creus8 min de lectura

El modelo de IA adecuado para tu empresa casi nunca es 1 solo modelo. En septiembre de 2026 la respuesta sensata es una cartera: un modelo de frontera para el 10% de tareas que exigen criterio, un modelo de gama media para el 80% que exige volumen, y un modelo de pesos abiertos o local allí donde los datos no pueden salir de tu control. Soy Xavi Creus, CEO y CTO de +10 empresas de SaaS e IA en Barcelona, y este es el marco que usamos para decidir.

Comparo la familia Claude 5, GPT-6 y GPT-5.6 de OpenAI, Gemini 3 de Google y los principales modelos de pesos abiertos en calidad, coste por millón de tokens, privacidad, latencia y residencia de datos en la UE, y termino con un marco de decisión sencillo. Todos los precios salen de las páginas de precios de los proveedores a 18 de septiembre de 2026 y cambiarán, así que lo duradero es el método.

Ideas clave

  • Elige por tarea, no por marca: modelos de frontera para el criterio y el trabajo agéntico largo, modelos de gama media para el volumen, modelos de pesos abiertos o locales donde los datos no pueden salir de tu control.
  • La diferencia de precio supera el 10 a 1: Claude Fable 5.1 cuesta 10$ por millón de tokens de entrada y 50$ de salida, Claude Sonnet 5 cuesta 2$ y 10$, y Gemini 3.8 Flash cuesta 0,75$ y 3,75$, según las páginas de precios de los proveedores.
  • Los modelos de pesos abiertos ya son opciones serias para empresas: Mistral Small 4 y DeepSeek V4 se publican con licencias Apache 2.0 y MIT, ventanas de contexto de 256K a 1M de tokens y pueden correr en hardware propio.
  • La residencia de datos en la UE es una decisión de configuración: Claude a través de los endpoints europeos de Bedrock o Vertex, la región europea de OpenAI y el alojamiento en la UE de Mistral mantienen la inferencia en Europa, y las obligaciones del Reglamento de IA para modelos de propósito general aplican desde el 2 de agosto de 2025.

¿Qué diferencia hay entre modelos de frontera, de pesos abiertos y locales?

Un modelo de frontera es el modelo más capaz que ofrece un laboratorio, disponible solo a través de su API o de un socio en la nube; un modelo de pesos abiertos es aquel cuyos parámetros entrenados se publican para que cualquiera pueda descargarlo y ejecutarlo; un modelo local es cualquier modelo, normalmente de pesos abiertos, que corre en hardware que posees o alquilas en exclusiva.

Las 3 categorías cambian capacidad por control. Los modelos de frontera como Claude Fable 5.1, GPT-6 Astra o Gemini 3.8 Flash son los más potentes y los más sencillos de usar, pero tus prompts van a los servidores del proveedor. Los modelos de pesos abiertos como Mistral Small 4, DeepSeek V4, Qwen 3.8 o Kimi K3 los puede servir un proveedor de nube que tú elijas o tú mismo, y la licencia decide qué puedes hacer con ellos. Local significa que los datos nunca salen del edificio.

¿Qué modelos de frontera existen en septiembre de 2026 y cuánto cuestan?

El nivel de frontera en septiembre de 2026 lo forman Claude Fable 5.1 y Opus 5 de Anthropic, GPT-6 Astra y GPT-5.6 de OpenAI, y Gemini 3.8 Flash y 3.1 Pro de Google, con precios de lista entre 0,75$ y 10$ por millón de tokens de entrada y entre 3,75$ y 50$ por millón de tokens de salida.

Un token equivale aproximadamente a 0,75 palabras, así que 1 millón de tokens son unas 700.000 palabras. Según la página de precios de Anthropic, Claude Fable 5.1 cuesta 10$ por millón de tokens de entrada y 50$ por millón de salida, Claude Opus 5 cuesta 5$ y 25$, Claude Sonnet 5 cuesta 2$ y 10$ y Claude Haiku 4.5 cuesta 1$ y 5$, con una ventana de contexto de 1 millón de tokens en los modelos Claude 5.

La página de precios de OpenAI lista GPT-6 Astra, su modelo estrella lanzado en septiembre de 2026, a 10$ y 50$; GPT-5.6 Sol a 4$ y 20$ con precio promocional al menos hasta el 21 de noviembre de 2026; GPT-5.6 Terra a 2$ y 12$; y GPT-5.6 Luna a 0,20$ y 1,20$. La página de precios de la API de Gemini de Google lista Gemini 3.8 Flash a 0,75$ y 3,75$ hasta el 31 de diciembre de 2026, subiendo después a 1,50$ y 7,50$, y Gemini 3.1 Pro Preview a 2$ y 12$ hasta 200K tokens. El procesamiento por lotes tiene un 50% de descuento en los 3 proveedores, y la entrada en caché cuesta el 10% del precio base o menos en Anthropic y OpenAI.

¿Qué modelos de pesos abiertos merece la pena considerar?

Los modelos de pesos abiertos que merece la pena considerar en 2026 son Mistral Small 4 y Large 3 (Apache 2.0), DeepSeek V4 Pro y V4 Flash (MIT), Qwen 3.8 (Apache 2.0 en el modelo de 27B) y Kimi K3 (licencia propia), porque cada uno tiene una licencia permisiva y una ventana de contexto de 256K tokens o más.

Mistral es la opción europea. Mistral Small 4, publicado en marzo de 2026, tiene 119.000 millones de parámetros totales con 6.000 millones activos por token, una ventana de contexto de 256K, licencia Apache 2.0 y un precio de API de 0,15$ por millón de tokens de entrada y 0,60$ de salida, según el anuncio de Mistral. DeepSeek V4 Pro es un modelo de mezcla de expertos de 1,6 billones de parámetros con 49.000 millones activos, contexto de 1 millón de tokens y licencia MIT, según su ficha en Hugging Face. Revisa las licencias del resto: el modelo más grande de Qwen 3.8 y Kimi K3 llevan cláusulas de atribución por encima de 100 millones de usuarios mensuales o 20M$ de ingresos mensuales, y los modelos más recientes de Meta, Muse Spark, son solo por API. Lee la licencia antes de construir, no después.

  • Mistral Small 4: 119B totales / 6B activos, contexto de 256K, Apache 2.0, 0,15$ / 0,60$ en la API de Mistral.
  • DeepSeek V4 Pro: 1,6T totales / 49B activos, contexto de 1M, MIT; V4 Flash: 284B / 13B, MIT.
  • Qwen 3.8: modelo de 27B con Apache 2.0, el modelo estrella de 2,4T con licencia propia.
  • Kimi K3: 2,8T totales / 104B activos, contexto de 1M, licencia propia con cláusulas de atribución.

¿Cuándo tiene sentido un modelo local?

Un modelo local tiene sentido cuando los datos no pueden salir de tu control, cuando necesitas una latencia predecible sin viajes por la red, o cuando tu volumen es tan alto que tener el hardware sale más barato que pagar por token. Si no se cumple ninguna de las 3, usa una API.

El hardware ha avanzado más rápido de lo que cree la mayoría de CEOs: una estación de trabajo con 512 GB de memoria unificada ya puede cargar los mayores modelos de pesos abiertos por completo en el dispositivo, y una sola GPU de consumo de 32 GB ejecuta un modelo de 27B con holgura. En mis empresas los modelos locales se encargan de clasificar, extraer y hacer primeros borradores sobre documentos confidenciales. Todo lo que exige criterio sobre un contexto largo sigue yendo a un modelo de frontera, porque una respuesta equivocada cuesta más que los tokens.

  • Usa local cuando: datos regulados o confidenciales, requisitos on-premise, uso sin conexión, volumen alto y constante.
  • No uses local cuando: menos de 10 millones de tokens al mes, ningún ingeniero que se haga cargo, tareas que exigen criterio de frontera.

¿Cómo mantienes los datos de IA dentro de la UE?

Mantienes los datos de IA en la UE eligiendo un endpoint de inferencia europeo, que hoy ofrecen todos los grandes proveedores a través de su propia API o de un socio en la nube: Claude a través de las regiones europeas de Amazon Bedrock o Google Cloud, OpenAI a través de su región europea de API, Mistral alojado en la UE por defecto, y cualquier modelo de pesos abiertos en los servidores que tú elijas.

Según la documentación de Anthropic, Claude en Amazon Bedrock admite perfiles de inferencia europeos en Fráncfort, Zúrich, Estocolmo, Milán, España, Irlanda, Londres y París, con un recargo del 10% para los endpoints regionales, y en Google Cloud los modelos Claude 5 usan el endpoint multirregión "eu". La API propia de Anthropic ofrece una opción solo en EE. UU. pero todavía ninguna solo en la UE, así que la residencia europea para Claude pasa por los socios de nube. La guía de residencia de datos de OpenAI indica que su región europea realiza la inferencia dentro de la región, y el centro de ayuda de Mistral indica que los datos de los clientes se alojan en la Unión Europea por defecto.

Y luego está la ley. Las obligaciones del Reglamento de IA de la UE para modelos de propósito general aplican desde el 2 de agosto de 2025, sus normas de transparencia entraron en vigor en agosto de 2026 y el Ómnibus de IA, en vigor desde el 27 de julio de 2026, trasladó la mayoría de obligaciones de alto riesgo al 2 de diciembre de 2027, según la Comisión Europea. Para una empresa que usa modelos en soporte, back office o ventas, los deberes prácticos hoy son transparencia y protección de datos, no conformidad de alto riesgo.

¿Cuál es un marco sencillo para elegir un modelo de IA?

Divide tu trabajo con IA en 3 cajones y asigna un nivel a cada uno: las tareas de criterio van a un modelo de frontera, las tareas de volumen a un modelo de gama media, y las tareas confidenciales o reguladas a un modelo de pesos abiertos en infraestructura europea o local. Después enruta cada petición al nivel más barato que apruebe tu propia evaluación.

Tu propia evaluación es la clave. Los rankings como Arena y Artificial Analysis sirven para preseleccionar, y en septiembre de 2026 el Intelligence Index de Artificial Analysis muestra a Claude Fable 5.1, GPT-6 Astra y Claude Opus 5 en cabeza con diferencias pequeñas. Pero un modelo que gana un benchmark de programación puede perder con tus facturas en español. Construye de 50 a 100 ejemplos reales con la respuesta correcta, pasa por ellos a cada candidato y mide el coste por tarea completada, incluyendo reintentos y correcciones humanas.

Así lo hacemos en mis empresas: alrededor del 10% de las peticiones van a Fable 5.1 u Opus 5, cerca del 80% a Sonnet 5, Gemini 3.8 Flash o GPT-5.6 Terra, y el resto a un modelo de pesos abiertos en infraestructura que controlamos. Reevalúa cada trimestre: a Sonnet 5 ya le cancelaron una subida de precio prevista y Gemini 3.8 Flash duplica su precio en enero de 2027.

Elegir un modelo de IA en 2026 es un problema de enrutado, no de lealtad. El nivel de frontera, Claude Fable 5.1, Opus 5 y GPT-6 Astra, es para las tareas en las que el criterio vale 50$ por millón de tokens de salida. La gama media, Sonnet 5, Gemini 3.8 Flash y GPT-5.6 Terra, es donde debería vivir la mayor parte de tu volumen, a una quinta parte del precio o menos. Los modelos de pesos abiertos y el hardware local son para los datos que no puedes soltar. Pon tus propios 50 ejemplos delante de cada candidato, mide el coste por tarea completada, mantén la inferencia en la UE cuando los datos lo exijan y revisa la decisión cada trimestre. Eso es lo que hago en las empresas que dirijo.

Preguntas frecuentes

¿Cuál es el mejor modelo de IA para una empresa en 2026?
No hay un único mejor modelo. Claude Fable 5.1, Claude Opus 5 y GPT-6 Astra lideran en criterio y trabajo agéntico largo; Claude Sonnet 5, Gemini 3.8 Flash y GPT-5.6 Terra cubren el volumen a una fracción del precio; los modelos de pesos abiertos como Mistral Small 4 y DeepSeek V4 cubren la privacidad. Prueba cada uno con tus propias tareas.
¿Cuánto cuesta usar un modelo de IA de frontera?
Según las páginas de precios de los proveedores en septiembre de 2026, Claude Fable 5.1 y GPT-6 Astra cuestan 10$ por millón de tokens de entrada y 50$ por millón de salida, Claude Opus 5 cuesta 5$ y 25$, y Claude Sonnet 5 cuesta 2$ y 10$. El procesamiento por lotes reduce esos precios a la mitad y la entrada en caché cuesta el 10% o menos.
¿Puede una empresa usar Claude o GPT y mantener sus datos en la UE?
Sí. Claude corre en regiones europeas de Amazon Bedrock y a través del endpoint multirregión europeo de Google Cloud, y OpenAI ofrece una región europea de API con inferencia dentro de la región. Mistral aloja en la UE por defecto y sus modelos de pesos abiertos pueden correr en tus propios servidores.

Fuentes

  1. 01Anthropic: precios de la API de Claude
  2. 02OpenAI: precios de la API
  3. 03Google AI for Developers: precios de la API de Gemini
  4. 04Mistral AI: Mistral Small 4
  5. 05Hugging Face: ficha del modelo deepseek-ai/DeepSeek-V4-Pro
  6. 06Comisión Europea: marco regulatorio de la IA (calendario del Reglamento de IA)

¿Quieres aplicar esto en tu empresa?

Reserva una hora, una mañana o un día conmigo y convertiremos el artículo en decisiones.

Ver las sesiones