Moonshot AI acaba de publicar Kimi K3 junto con sus pesos. Es un modelo de 2,8T de parámetros, con una ventana de contexto de 1M de tokens y resultados competitivos en varios benchmarks de agentes y código, que sitúan a este modelo muy cerca del nivel frontier.

Entrenar un modelo de este tamaño requiere una cantidad enorme de cómputo, datos y trabajo de ingeniería. A primera vista parece contraintuitivo hacer esa inversión y después publicar los pesos. Moonshot podría mantener K3 detrás de su propia API, servir toda la inferencia y tratar de recuperar una mayor parte del coste de entrenamiento directamente de los clientes que lo usan.

Entonces, ¿para qué publicar los pesos? Creo que el motivo estratégico más importante es la distribución, porque publicar los pesos da a laboratorios como Moonshot una vía hacia la distribución que ya tienen OpenAI, Anthropic y Google.

Open weights no significa open source

Antes de hablar de estrategia, conviene separar dos ideas que se mezclan constantemente. Publicar pesos significa que otra persona puede descargar los parámetros entrenados y usarlos para ejecutar el modelo, hacer fine-tuning o integrarlo en su propio stack de inferencia. En la práctica, una publicación open weight suele incluir información suficiente para cargar el modelo, como la configuración de su arquitectura y el tokenizer. Eso es suficiente para que un proveedor de inferencia opere el modelo sin llamar a la API del laboratorio.

Sin embargo, eso no hace que el modelo sea totalmente reproducible ni transparente. Los datos de entrenamiento, el código de entrenamiento, el pipeline de post-training y gran parte del trabajo de evaluación siguen siendo privados. La publicación da acceso al resultado de ese trabajo, no necesariamente al proceso que lo produjo. En sentido estricto, muchos de estos lanzamientos son open weight, no open source. La distinción importa para el resto del post porque publicar los pesos permite que otros operadores sirvan el modelo, pero no significa que el laboratorio haya hecho pública toda su investigación.

Distribución

Un laboratorio nuevo no compite solo por la calidad del modelo. Compite con una API ya integrada en proyectos, SDKs, agentes, proveedores cloud y herramientas de desarrollo. OpenAI, Anthropic y Google tienen esa distribución. En muchas aplicaciones, cambiar entre modelos del mismo proveedor consiste en cambiar el identificador del modelo y, quizá, hacer algunos ajustes al system prompt.

Las suscripciones también reducen la fricción, porque permiten que mucha gente pruebe un modelo barato dentro de una herramienta pulida y, al mismo tiempo, acostumbran a los equipos a sus APIs y SDKs. La facturación seria suele llegar cuando esos flujos se convierten en procesos automatizados y productos B2B.

Un laboratorio que llega más tarde puede tener un modelo muy bueno y aun así no tener esa distribución, pero publicar los pesos le permite convertir a otras empresas en distribuidores. Empresas como Together AI, Fireworks, DeepInfra, Modal e incluso proveedores cloud como Google Cloud y AWS pueden desplegar el modelo, ofrecer un endpoint compatible con sus clientes y meterlo en los catálogos que ya usan desarrolladores y empresas. Estos proveedores ya tienen la facturación, el soporte y la API que sus clientes saben operar.

Publicar modelos open weight no es estrictamente la unica manera de lograr esto. Los modelos de OpenAI y Anthropic también están disponibles a través de proveedores cloud tradicionales, pero esos acuerdos existen porque los modelos ya tienen demanda y porque las empresas han alcanzado ciertos acuerdos comerciales. Un laboratorio chino con menos tracción empresarial puede tener más dificultades para conseguir los mismos acuerdos de distribución con grandes proveedores cloud estadounidenses. Si los pesos están disponibles, un proveedor de inferencia puede desplegar el modelo de forma independiente en cuanto su stack de inferencia lo soporte.

Laboratorios chinos

Consumir una API de un proveedor chino puede añadir fricción que no existe con proveedores occidentales. Hay preguntas sobre residencia de datos, soporte y cumplimiento normativo que pueden bloquear un cambio incluso si el modelo es interesante. Servir los mismos pesos a través de un proveedor independiente con sede en Estados Unidos o la Unión Europea puede eliminar parte de esa fricción, especialmente en torno a la residencia de datos, la facturación y las relaciones existentes con proveedores.

También hay un contexto de cómputo. Un laboratorio tiene que dividir su cómputo entre servir el modelo actual y construir el siguiente. Las GPUs usadas para inferencia no están ejecutando experimentos ni entrenando un nuevo modelo. Si un laboratorio asigna la mayor parte de su cómputo a investigación y entrenamiento, se queda con una inferencia más lenta y menos capacidad para servir usuarios, y si asigna la mayor parte a inferencia, la investigación y el entrenamiento de la siguiente generación se ralentizan.

Los laboratorios occidentales tienen el mismo problema, pero los laboratorios chinos pueden tenerlo más limitado. Los controles estadounidenses a la exportación han restringido la venta a China de GPUs de alto rendimiento y de los sistemas que las incorporan, lo que puede dificultar servir simultáneamente todo el tráfico de los modelos entrenados y seguir iterando en investigación y entrenamiento.

Una release abierta puede permitir que proveedores externos asuman parte de la demanda de inferencia, dejando potencialmente más capacidad de cómputo disponible para investigación y entrenamiento.

Open weights no significa que sea barato de ejecutar

Cuando un modelo se publica como open weight, la gente suele asumir que una de sus ventajas será que costará menos que los modelos frontier y que se podrá ejecutar de manera local, y esto no tiene por qué ser cierto. Los modelos frontier pueden mejorar mediante arquitectura, datos, post-training RL y test-time compute, pero a menudo siguen siendo caros de ejecutar incluso con mejoras de eficiencia arquitectónica. Las empresas que intentan competir en el frontier no van a rebajar sus objetivos de capacidad solo para hacer un modelo más accesible a usuarios locales.

Kimi K3 tiene 2,8T de parámetros. Qwen 3.8 Max tiene 2,4T. GLM-5.2 no llega al billón de parámetros, pero es caro de ejecutar. Con modelos de estos tamaños, es difícil hacer que sean baratos de servir, así que sus precios por token no tienen por qué diferir mucho de los de modelos frontier. La comparación más útil es el coste por tarea completada, y según el modelo, la carga de trabajo, las tool calls y la longitud de razonamiento, un modelo open weight con un rendimiento similar puede costar lo mismo o más que un modelo de OpenAI o Anthropic. La evaluación de Kimi K3 de Artificial Analysis es un buen ejemplo de esa distinción.

Es importante que los modelos open weight ya puedan competir con los modelos de OpenAI y Anthropic, pero es un error asumir que siempre son más baratos.

La otra suposición es que un modelo open weight se puede ejecutar localmente sin importar su tamaño. La comunidad ha hecho muchos experimentos cargando pesos desde SSDs, descargando capas y ejecutando la inferencia capa a capa cuando no hay hardware suficiente. Son experimentos útiles, pero la inferencia local de modelos de este tamaño no es práctica fuera de la experimentación y el ocio. Que un modelo acabe produciendo un token eventualmente no es lo mismo que servir un coding agent o a varios usuarios con una velocidad y concurrencia utilizables.

Estos modelos no están diseñados pensando en la inferencia sobre hardware de consumo. Se pueden autoalojar con infraestructura suficiente, pero un despliegue privado práctico es muy distinto de ejecutarlos en local en una workstation.

Las publicaciones open weight son muy importantes

La pregunta útil es qué cambia cuando un modelo frontier se publica como open weight y se puede servir fuera del laboratorio que lo entrenó.

Los pesos abiertos dan al usuario más control sobre dónde van sus datos. Una empresa puede elegir un proveedor de inferencia según su región de datos o requisitos de seguridad, en vez de enviar todas las peticiones al laboratorio original. También puede alquilar capacidad en un datacenter y ejecutar allí el modelo de forma privada. Eso no elimina el trabajo de asegurar el despliegue, pero da a la empresa una elección que no existe con un modelo que solo se puede llamar a través de la API de un proveedor.

Cuando un modelo solo está disponible a través de una API, la empresa que lo aloja decide para qué se puede usar y para qué no. Esos límites pueden chocar directamente con los intereses de la persona que necesita el modelo, incluso cuando el uso es legítimo. La system card de Fable 5 de Anthropic describía salvaguardas para un conjunto limitado de tareas de desarrollo de LLMs frontier que no serían visibles para el usuario. Esas peticiones podían redirigirse a un modelo menos capaz sin una indicación clara de que Fable había sido limitado. Tras las críticas de la comunidad, Anthropic cambió el fallback para que los usuarios puedan ver cuándo las peticiones afectadas vuelven a Opus 4.8.

HuggingFace informó recientemente de que sus primeros intentos de analizar una intrusión dirigida por un agente con modelos frontier fueron bloqueados por las salvaguardas del proveedor. La investigación requería enviar comandos reales del atacante y payloads de exploits, y las salvaguardas no podían distinguir a quien respondía al incidente de un atacante. HuggingFace realizó el análisis forense usando GLM-5.2, un modelo open weight, en su propia infraestructura. Así, los datos del atacante y las credenciales a las que se hacía referencia se mantuvieron dentro de su entorno. Su informe del incidente es un ejemplo útil de por qué un equipo defensivo puede necesitar un modelo capaz que pueda operar por sí mismo, sin quedar bloqueado por los refusals de ciberseguridad de un proveedor.

Los modelos frontier open weight no necesitan ser más baratos, más cost-effective ni fáciles de ejecutar en local para ser importantes. Dan más control sobre dónde van nuestros datos y sobre los usos que podemos hacer de un modelo.