Delegue tarefas de compreensão de imagem a modelos de visão configuráveis compatíveis com a OpenAI quando a visão nativa estiver indisponível.
Adicione reconhecimento de imagem, OCR e raciocínio visual a ambientes do Claude Code que não possuem recursos de visão nativos por meio de um script Python leve.
Um fluxo de trabalho focado com valor mensurável.
Estrelas
3
Forks
0
Atualizado
8 de ago. de 2026
Veja e compreenda imagens quando você (o modelo atual) não tiver visão nativa. Use isto SEMPRE que precisar olhar, ler, descrever, fazer OCR ou raciocinar sobre o conteúdo de uma imagem, captura de tela, foto, diagrama, gráfico, protótipo de IU ou página digitalizada — inclusive quando o usuário fizer referência a um arquivo de imagem local ou a um URL de imagem e você não puder visualizá-lo por conta própria.
Delega tarefas de processamento de imagem, como análise de capturas de tela, extração de texto por OCR, revisão de protótipos de IU e interpretação de diagramas, a um modelo de visão externo a partir de um ambiente apenas de texto.
Extração de texto e formatação de recibos e páginas digitalizadas
Depuração de logs de erro de software capturados por meio de capturas de tela
Conversão de gráficos e diagramas visuais em tabelas em markdown
Comparação da implementação de IU em relação a protótipos de design
Explicação de diagramas de arquitetura de software e recursos de imagem remotos
npx skills add kotot/vision@visionTópicos e capacidades