Delegare i compiti di comprensione delle immagini a modelli visivi configurabili compatibili con OpenAI quando la visione nativa non è disponibile.
Introduci il riconoscimento di immagini, l'OCR e il ragionamento visivo negli ambienti Claude Code privi di capacità di visione native tramite un leggero script in Python.
Un flusso di lavoro mirato con un valore misurabile.
Stelle
3
Fork
0
Aggiornato
8 ago 2026
Guarda e comprendi le immagini quando tu (il modello attuale) non disponi di una visione nativa. Usalo SEMPRE che hai bisogno di guardare, leggere, descrivere, eseguire l'OCR o ragionare sui contenuti di un'immagine, uno screenshot, una foto, un diagramma, un grafico, un mockup di interfaccia o una pagina scansionata, incluso quando l'utente fa riferimento a un file di immagine locale o a un URL di immagine e tu non puoi visualizzarlo autonomamente.
Delega attività di elaborazione delle immagini come l'analisi di screenshot, l'estrazione di testo OCR, la revisione di mockup di interfaccia e l'interpretazione di diagrammi a un modello di visione esterno da un ambiente di solo testo.
Estrazione di testo e formattazione da ricevute e pagine scansionate
Debug di log di errori software catturati tramite screenshot
Conversione di grafici e diagrammi visivi in tabelle markdown
Confronto dell'implementazione dell'interfaccia utente rispetto ai mockup di design
Spiegazione di diagrammi di architettura software e risorse di immagini remote
npx skills add kotot/vision@visionArgomenti e funzionalità