Moonshot presenta Kimi K3, un modelo de 2,8 billones de parámetros para agentes y código
Moonshot presenta Kimi K3, un modelo de 2,8 billones de parámetros para agentes y código
Moonshot AI lanzó Kimi K3, un modelo de gran escala que la compañía orienta a programación, trabajo de conocimiento y tareas paralelas con agentes. El anuncio refuerza la competencia entre laboratorios chinos y estadounidenses, pero sus comparaciones de rendimiento todavía dependen en gran medida de evaluaciones divulgadas por el propio desarrollador.
Qué ocurrió
La empresa china Moonshot AI presentó Kimi K3 el 17 de julio. La página oficial de Kimi ya lo ofrece como la base de funciones para crear juegos multijugador y experiencias 3D, preparar presentaciones y ejecutar trabajos en paralelo mediante herramientas llamadas Swarm y Goal. Es una propuesta que intenta llevar el modelo más allá de la conversación: el producto se presenta como un sistema capaz de producir entregables y coordinar varias tareas.
CNBC reportó que K3 tiene 2,8 billones de parámetros, una medida del tamaño de su red neuronal. Según Moonshot, el modelo superó a Claude Opus 4.8 y GPT-5.5 en algunas pruebas de código y agentes generales. La misma cobertura señala, sin embargo, que K3 todavía queda por debajo de Claude Fable 5 y GPT-5.6 Sol en rendimiento general. Reuters describió el lanzamiento como el mayor modelo abierto presentado hasta ahora, aunque la disponibilidad práctica de pesos, la licencia y los requisitos de ejecución deben evaluarse por separado.
Por qué importa
El tamaño llama la atención, pero el ángulo más relevante para usuarios y empresas es el tipo de trabajo que Moonshot quiere automatizar. Programación, elaboración de presentaciones, investigación y coordinación de tareas son actividades donde un modelo no solo debe redactar una respuesta: necesita mantener contexto, usar herramientas, dividir objetivos y entregar resultados verificables.
K3 también muestra que la carrera de modelos ya no se mide únicamente por quién encabeza una tabla. Los desarrolladores compiten en costo, apertura, disponibilidad, integración con herramientas y capacidad de completar flujos de trabajo. Un modelo que quede ligeramente por debajo en una evaluación agregada todavía puede ser atractivo si ofrece una combinación útil de precio, control y desempeño en tareas específicas.
Para el ecosistema, el lanzamiento aumenta la presión sobre proveedores estadounidenses y chinos. CNBC señaló que modelos chinos han ganado interés fuera de China a medida que reducen la brecha de desempeño y ofrecen costos competitivos. Esa tendencia puede ampliar las opciones para desarrolladores, aunque también obliga a revisar con cuidado licencias, privacidad, residencia de datos, soporte y cumplimiento antes de adoptar un proveedor.
Qué cambia para usuarios y empresas
Para usuarios de Kimi, el cambio inmediato es el acceso a una nueva generación del producto con funciones orientadas a entregables complejos y trabajo paralelo. Para equipos técnicos, la promesa es contar con un modelo potente para código y agentes. Para empresas, el valor potencial está en comparar resultados reales dentro de sus propios procesos, no en trasladar automáticamente los benchmarks del proveedor a producción.
Una evaluación responsable debería probar precisión, estabilidad, costo total, latencia, seguridad de herramientas y calidad de los resultados finales. En tareas agénticas también importa qué permisos recibe el sistema, cómo registra sus acciones y si un humano puede detener o corregir el flujo. Tener más parámetros no responde por sí solo a esas preguntas.
Qué todavía no está claro
Moonshot no ha presentado en la página pública de Kimi una evaluación independiente completa que permita reproducir todas las comparaciones citadas. Tampoco queda resuelto, a partir de esa página, qué variantes o pesos estarán disponibles, bajo qué licencia y con qué infraestructura podrían ejecutarse fuera del servicio alojado.
Por eso, Kimi K3 debe entenderse como un lanzamiento importante y una señal de competencia técnica, no como prueba definitiva de superioridad. Las cifras de benchmark son útiles para orientar pruebas, pero el veredicto dependerá de evaluaciones independientes y del desempeño en cargas de trabajo reales.
Redactado por Nova Rivera — Perspectiva de producto y automatización.
Fuentes consultadas
Moonshot AI/Kimi, CNBC y Reuters. Los enlaces canónicos exactos aparecen en la sección “Fuentes” debajo.
Fuentes: Moonshot AI / Kimi, CNBC, Reuters