>_ DevTrendsit

Lingua

Home

Linguaggi

Sezioni

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicurezza
Python

NVIDIA apre il framework Cosmos per l'addestramento e l'esecuzione di World Model

Quando gli sviluppatori parlano di reti multimodali, di solito intendono una combinazione di testo e immagini. NVIDIA è andata oltre e ha rilasciato la famiglia Cosmos 3 — world model in cui testo, video, audio e sequenze di azioni fisiche sono combinati in un'unica architettura Mixture-of-Transformers. Per lavorare con questa famiglia, l'azienda ha rilasciato un repository cosmos-framework.

Cosa c'è dentro il Framework

Il codice è raggruppato in un singolo pacchetto Python cosmos_framework. Il progetto è pensato per ingegneri che necessitano di fare fine-tuning di modelli multimodali per task specifici o di distribuirli in produzione. Se stai lavorando su robotica o generazione video con comportamento controllabile, questo repository ti farà risparmiare molto tempo sulla scrittura di codice boilerplate.

Tutta la logica è suddivisa in due blocchi principali.

Il primo blocco gestisce il training distribuito. Lo strumento supporta parallelismo FSDP, tensor (TP), context (CP) e pipeline (PP). I checkpoint vengono salvati in formato DCP, ma il codice include la conversione al familiare formato HuggingFace safetensors. La preparazione dei dati è semplificata con adattatori già pronti per JSONL, WebDataset, HuggingFace e LeRobot. Lo script principale di avvio si trova in cosmos_framework.scripts.train.

Il secondo blocco gestisce l'inference. Sotto il cofano, puoi usare i backend Diffusers, Transformers, vLLM o wrapper personalizzati. Per la generazione in background è disponibile una modalità offline, e per la creazione di API viene distribuito uno stack Ray e Gradio. L'inference viene avviata attraverso il modulo cosmos_framework.scripts.inference.

Per i task di robotica, il framework include un Policy Server. Serve il modello Cosmos3-Policy-DROID e passa i comandi generati direttamente agli attuatori.

Requisiti Hardware e Primo Avvio

L'appetito hardware del progetto è sostanziale. Le configurazioni già pronte dalla cartella examples sono state testate su server con 8 schede NVIDIA H100 da 80GB. Puoi regolare il grado di parallelismo e i parametri di sharding attraverso NPROC_PER_NODE e le impostazioni FSDP, ma non sarà possibile addestrare un modello su una singola GPU consumer.

Il progetto utilizza il gestore di pacchetti uv per la configurazione dell'ambiente. Gli autori consigliano di iniziare con l'immagine Docker ufficiale NVIDIA NGC (nvcr.io/nvidia/pytorch:25.09-py3).

L'installazione delle dipendenze di sistema si presenta così:

sudo apt-get install -y --no-install-recommends curl ffmpeg git-lfs libx11-dev tree wget

La creazione di un ambiente virtuale per CUDA 13.0 viene eseguita con un singolo comando:

uv sync --all-extras --group=cu130-train
source .venv/bin/activate && export LD_LIBRARY_PATH=

Per testare l'inference su una singola GPU, il repository include un preset già pronto:

python -m cosmos_framework.scripts.inference \
    --parallelism-preset=latency \
    -i "inputs/omni/t2v.json" \
    -o outputs/omni_nano \
    --checkpoint-path Cosmos3-Nano \
    --seed=0

Integrazione Automatica con Coding Agent

Un dettaglio interessante: gli autori hanno integrato il supporto per assistenti AI nella struttura del repository. La directory .agents/skills/ contiene istruzioni già pronte per Cursor, Claude Code e Codex CLI.

All'interno troverai diversi file in formato SKILL.md. Ogni istruzione copre la propria area:

  • Configurazione dell'ambiente, download dei pesi e lavoro con Docker
  • Navigazione dei file del pacchetto cosmos_framework
  • Configurazione dell'inference e dei parametri di parallelismo
  • Ciclo completo di fine-tuning SFT dalla preparazione dei dati all'esportazione
  • Diagnostica di errori CUDA, OOM e crash dei container

Quando chiedi a Claude Code o Cursor di correggere un errore di importazione o modificare un parametro nello script di avvio, l'agente carica automaticamente il file di regole corrispondente dalla directory .agents/skills/.

Vale la Pena Provarlo

Il framework sarà utile per i team di robotica e gli sviluppatori di sistemi di generazione video. Il repository è ancora giovane, ma include già un set completo di strumenti per il workflow del modello: dal caricamento dei dataset al controllo dell'hardware fisico.

Se hai accesso a cluster GPU e stai cercando un framework già pronto per sperimentare con i world model, dai un'occhiata a cosmos-framework. Gli script nella cartella examples ti daranno un buon punto di partenza.

Progetti correlati