Déléguez les tâches de compréhension d'image à des modèles de vision configurables compatibles avec OpenAI lorsque la vision native n'est pas disponible.
Ajoutez la reconnaissance d'images, l'OCR et le raisonnement visuel aux environnements Claude Code dépourvus de capacités de vision natives grâce à un script Python léger.
Un flux de travail ciblé à valeur mesurable.
Étoiles
3
Forks
0
Mis à jour
8 août 2026
Voyez et comprenez les images lorsque vous (le modèle actuel) ne disposez pas d'une vision native. Utilisez cette fonction CHAQUE FOIS que vous devez examiner, lire, décrire, effectuer une OCR ou raisonner sur le contenu d'une image, d'une capture d'écran, d'une photo, d'un diagramme, d'un graphique, d'une maquette d'interface utilisateur ou d'une page numérisée — y compris lorsque l'utilisateur fait référence à un fichier image local ou à une URL d'image que vous ne pouvez pas visualiser vous-même.
Délègue des tâches de traitement d'images telles que l'analyse de captures d'écran, l'extraction de texte par OCR, l'examen de maquettes d'interface utilisateur et l'interprétation de diagrammes à un modèle de vision externe depuis un environnement textuel.
Extraction de texte et de mise en forme à partir de reçus et de pages numérisées
Débogage de journaux d'erreurs logiciels capturés via des captures d'écran
Conversion de graphiques et diagrammes visuels en tableaux markdown
Comparaison de l'implémentation de l'interface utilisateur par rapport aux maquettes de conception
Explication de diagrammes d'architecture logicielle et de ressources d'images distantes
npx skills add kotot/vision@visionSujets et capacités