Come Inserire una Parete di Codice in una Rete Neurale come Immagine e Risparmiare il 60% sul Budget dei Token
Mi sono recentemente reso conto che ci siamo abituati a trattare le finestre di contesto dei modelli linguistici esclusivamente come testo. Invi un file di 50.000 caratteri e paghi per 12–15.000 token di testo. Se stai eseguendo Claude Code o Cursor per ore, il contesto viene costantemente riempito con istruzioni di sistema, documentazione degli strumenti e log di esecuzione dei comandi. Il conto API alla fine del mese inizia a diventare una brutta sorpresa.
Gli sviluppatori dietro il progetto pxpipe hanno notato una falla interessante nei prezzi dei moderni modelli multimodali. Il costo di un'immagine in token dipende solo dalla sua risoluzione fisica in pixel, non da quanto testo viene disegnato su di essa. Se comprimi testo denso in uno screenshot compatto con caratteri piccoli, un token immagine può contenere circa 3–5 volte più caratteri di un token di testo standard.

E così è nata l'idea di un server proxy locale che ridisegna le parti pesanti di una richiesta in pagine PNG monocromatiche al volo prima di inviarle ad Anthropic o OpenAI.
Come Funziona Questo Trucco
In formato testo, dati densi come JSON, dump di database o codice vengono consumati a una velocità di circa un carattere per token. Nel frattempo, modelli moderni come Claude 3.5 Sonnet, Claude Opus o Gemini riconoscono eccellentemente le immagini raster attraverso i loro moduli di visione integrati.
Lo strumento pxpipe intercetta le richieste API in uscita dal tuo computer e suddivide il contesto ingombrante in immagini dense con un font monospace personalizzato (ad esempio, Spleen 5×8 o JetBrains Mono).

invece di 25.000 token di testo grezzo per il prompt di sistema e le descrizioni degli strumenti, il modello riceve un paio di immagini che pesano solo 2.700 token. Per una finestra di contesto di 1 milione di token, questo aumenta la capacità effettiva di caratteri di quasi cinque volte: da 4 milioni di caratteri a 19–21 milioni.
Cosa Viene Compresso e Cosa Resta come Testo
Se trasformi l'intero dialogo in un'immagine, il modello inevitabilmente inizierà a commettere errori con identificatori precisi. Gli sviluppatori di pxpipe hanno tenuto conto di questo, quindi la compressione funziona in modo selettivo:
- Risultati di esecuzione di strumenti di grandi dimensioni. Se l'output della console, i log dei test o un file letto supera i 6.000 caratteri, vengono convertiti in PNG.
- Cronologia dei messaggi precedenti. I passaggi iniziali di una lunga sessione vengono compattati in pagine di archivio.
- Prompt di sistema pesanti e specifiche degli strumenti MCP. Vengono memorizzati nella cache e inviati come foglio grafico.
Le risposte più recenti dell'utente, le risposte fresche del modello ei frammenti di testo brevi vengono trasmessi nella loro forma di testo originale invariata. Il modello vede le modifiche recenti byte per byte.
Avvio Rapido e Connessione agli Agent
Puoi eseguire l'utility senza installazione permanente tramite npx. Avvia un server locale sulla porta 47821:
npx pxpipe-proxy
Dopo di che, punta semplicemente Claude Code all'indirizzo locale:
ANTHROPIC_BASE_URL=http://127.0.0.1:47821 claude
Se non vuoi avere a che fare con le variabili d'ambiente, il repository include un comando wrapper warp. Proxy delle chiamate di rete per un processo specifico:
pxpipe warp -- claude
# либо для других агентов
pxpipe warp -- cursor-agent
Insieme al proxy, si avvia una dashboard web su http://127.0.0.1:47821/. Visualizza i dollari risparmiati in tempo reale, il numero di token tagliati e un'anteprima di ogni pagina generata insieme al testo originale.
Esporta senza Avviare un Server
Se non hai bisogno di un proxy ma vuoi inserire una base di codice massiccia o un diff git in un'interfaccia web di chat con supporto immagini, puoi usare la modalità export:
npx pxpipe-proxy export src/
cat logs.txt | npx pxpipe-proxy export --stdin
npx pxpipe-proxy export --git
Il comando crea una cartella con file page-*.png pronti all'uso, un breve file delle entità chiave factsheet.txt e un prompt da incollare nella finestra di dialogo.
L'Altra Faccia della Medaglia e Limitazioni Oneste
L'approccio sembra una scorciatoia, ma ha limitazioni fisiche inevitabili. Gli sviluppatori le elencano direttamente nella documentazione:
- Perdita di accuratezza su hash e ID. Il modulo di visione LLM funziona attraverso patch di embedding, non OCR classico con probabilità per carattere. Quando non ci sono abbastanza pixel per lettera, il modello linguistico semplicemente inventa un carattere plausibile. Nei test degli autori, le corrispondenze esatte di stringhe esadecimali di 12 caratteri su Fable 5 sono arrivate a 13 su 15, e su alcuni modelli sono scese a zero. Gli identificatori critici è meglio conservarli nel testo.
- Ritardo di rendering. Prima di inviare una richiesta grande, il processore trascorre diversi centinaia di millisecondi generando buffer PNG in memoria.
- Il beneficio dipende dalla densità del contenuto. Il risparmio è massimo su codice, stack trace e strutture JSON. Sul testo conversazionale normale in linguaggio naturale, il guadagno è minimo o assente, perché nel testo normale un token già contiene circa 3–4 caratteri.
Per Chi il Progetto Sarà Utile Adesso
Se usi regolarmente agenti di coding autonomi, esegui benchmark o fornisci al modello log di build di più megabyte, pxpipe si ripaga dal primo giorno. Nelle lunghe sessioni di debug, il conto giornaliero scende da $40 a $6–7 preservando la logica generale dell'operazione dell'agente.
Puoi provare lo strumento in un paio di minuti e per il primo test non hai nemmeno bisogno di compilare nulla dal codice sorgente. Tutte le statistiche sui token sono archiviate ordinatamente dall'utility in un log locale ~/.pxpipe/events.jsonl, quindi puoi verificare facilmente il beneficio reale sui tuoi compiti con l'utility pxpipe stats.
Progetti correlati