NVIDIA Abre el Framework Cosmos para Entrenar y Ejecutar Modelos de Mundo
Cuando los desarrolladores hablan de redes multimodales, generalmente se refieren a una combinación de texto e imágenes. NVIDIA fue más allá y lanzó la familia Cosmos 3 — modelos de mundo donde el texto, el video, el audio y las secuencias de acciones físicas se combinan en una única arquitectura Mixture-of-Transformers. Para trabajar con esta familia, la empresa publicó un repositorio cosmos-framework.
Qué hay dentro del Framework
El código se empaqueta en un único paquete Python cosmos_framework. El proyecto está diseñado para ingenieros que necesitan ajustar modelos multimodales para tareas específicas o desplegarlos en producción. Si estás trabajando en robótica o generación de video con comportamiento controlable, este repositorio te ahorrará mucho tiempo en escribir código repetitivo.
Toda la lógica se divide en dos bloques principales.
El primer bloque gestiona el entrenamiento distribuido. La herramienta soporta paralelismo FSDP, tensor (TP), de contexto (CP) y de pipeline (PP). Los checkpoints se guardan en formato DCP, pero el código incluye conversión al familiar HuggingFace safetensors. La preparación de datos se simplifica con adaptadores listos para usar para JSONL, WebDataset, HuggingFace y LeRobot. El script principal de lanzamiento está en cosmos_framework.scripts.train.
El segundo bloque gestiona la inferencia. Internamente, puedes usar los backends Diffusers, Transformers, vLLM o wrappers personalizados. Para generación en segundo plano, hay disponible un modo offline, y para creación de APIs se despliega una pila de Ray y Gradio. La inferencia se lanza a través del módulo cosmos_framework.scripts.inference.
Para tareas de robótica, el framework incluye un Policy Server. Este sirve el modelo Cosmos3-Policy-DROID y pasa los comandos generados directamente a los actuadores.
Requisitos de Hardware y Primer Lanzamiento
El apetito de hardware del proyecto es sustancial. Las configuraciones listas para usar de la carpeta examples se probaron en servidores con 8 tarjetas NVIDIA H100 de 80GB. Puedes ajustar el grado de paralelismo y los parámetros de sharding a través de NPROC_PER_NODE y la configuración de FSDP, pero entrenar un modelo en una sola GPU de consumidor no será posible.
El proyecto utiliza el gestor de paquetes uv para la configuración del entorno. Los autores recomiendan comenzar con la imagen Docker oficial de NVIDIA NGC (nvcr.io/nvidia/pytorch:25.09-py3).
La instalación de dependencias del sistema se ve así:
sudo apt-get install -y --no-install-recommends curl ffmpeg git-lfs libx11-dev tree wget
Construir un entorno virtual para CUDA 13.0 se hace con un solo comando:
uv sync --all-extras --group=cu130-train
source .venv/bin/activate && export LD_LIBRARY_PATH=
Para probar inferencia en una sola GPU, el repositorio incluye un preset listo para usar:
python -m cosmos_framework.scripts.inference \
--parallelism-preset=latency \
-i "inputs/omni/t2v.json" \
-o outputs/omni_nano \
--checkpoint-path Cosmos3-Nano \
--seed=0
Integración Automática con Agentes de Código
Un detalle interesante: los autores integraron soporte para asistentes de IA en la estructura del repositorio. El directorio .agents/skills/ contiene instrucciones listas para usar para Cursor, Claude Code y Codex CLI.
Dentro encontrarás varios archivos en formato SKILL.md. Cada instrucción cubre su propia área:
- Configuración del entorno, descarga de pesos y trabajo con Docker
- Navegación por los archivos del paquete
cosmos_framework - Configuración de inferencia y parámetros de paralelismo
- Ciclo completo de fine-tuning SFT desde la preparación de datos hasta la exportación
- Diagnóstico de errores CUDA, OOM y fallos de contenedores
Cuando le pidas a Claude Code o Cursor que corrija un error de importación o modifique un parámetro en el script de lanzamiento, el agente cargará automáticamente el archivo de reglas correspondiente del directorio .agents/skills/.
¿Vale la Pena Probarlo
El framework será útil para equipos de robótica y desarrolladores de sistemas de video generativo. El repositorio aún es joven, pero ya incluye un conjunto completo de herramientas para el flujo de trabajo del modelo: desde la carga de datasets hasta el control de hardware físico.
Si tienes acceso a clusters de GPU y estás buscando un framework listo para usar para experimentar con modelos de mundo, échale un vistazo a cosmos-framework. Los scripts de la carpeta examples te darán un buen punto de partida.
Proyectos relacionados