Delegue tareas de comprensión de imágenes a modelos de visión configurables compatibles con OpenAI cuando no se disponga de visión nativa.
Incorpore reconocimiento de imágenes, OCR y razonamiento visual a entornos de Claude Code que carezcan de capacidades de visión nativas mediante un script ligero en Python.
Un flujo de trabajo enfocado con un valor medible.
Estrellas
3
Bifurcaciones
0
Actualizado
8 de ago. de 2026
Ve y comprende imágenes cuando tú (el modelo actual) no tienes visión nativa. Úsalo SIEMPRE que necesites mirar, leer, describir, aplicar OCR o razonar sobre el contenido de una imagen, captura de pantalla, foto, diagrama, gráfico, maqueta de interfaz o página escaneada, incluso cuando el usuario haga referencia a un archivo de imagen local o una URL de imagen y no puedas verla por ti mismo.
Delega tareas de procesamiento de imágenes, como el análisis de capturas de pantalla, la extracción de texto por OCR, la revisión de maquetas de interfaz y la interpretación de diagramas, a un modelo de visión externo desde un entorno de solo texto.
Extracción de texto y formato de recibos y páginas escaneadas
Depuración de registros de errores de software capturados mediante capturas de pantalla
Conversión de gráficos y diagramas visuales en tablas de markdown
Comparación de la implementación de la interfaz de usuario con las maquetas de diseño
Explicación de diagramas de arquitectura de software y recursos de imagen remotos
npx skills add kotot/vision@visionTemas y capacidades