Delegieren Sie Bildverständnis-Aufgaben an konfigurierbare OpenAI-kompatible Vision-Modelle, wenn keine native Bilderkennung verfügbar ist.
Bringen Sie Bilderkennung, OCR und visuelles Schlussfolgern über ein leichtgewichtigenes Python-Skript in Claude Code-Umgebungen, denen native Bildfunktionen fehlen.
Ein fokussierter Workflow mit messbarem Nutzen.
Sterne
3
Forks
0
Aktualisiert
8. Aug. 2026
Sehen und verstehen Sie Bilder, wenn Sie (das aktuelle Modell) keine native Vision besitzen. Verwenden Sie dies IMMER, wenn Sie den Inhalt eines Bildes, Screenshots, Fotos, Diagramms, Charts, UI-Mockups oder einer gescannten Seite betrachten, lesen, beschreiben, per OCR erfassen oder analysieren müssen – einschließlich des Falls, dass der Benutzer auf eine lokale Bilddatei oder eine Bild-URL verweist und Sie diese nicht selbst anzeigen können.
Delegiert Bildverarbeitungsaufgaben wie Screenshot-Analyse, OCR-Textextraktion, Überprüfung von UI-Mockups und Diagramminterpretation aus einer reinen Textumgebung heraus an ein externes Visionsmodell.
Extrahieren von Text und Formatierung aus Belegen und gescannten Seiten
Debuggen von Software-Fehlerprotokollen, die über Screenshots erfasst wurden
Konvertieren visueller Charts und Diagramme in Markdown-Tabellen
Vergleichen der UI-Implementierung mit Design-Mockups
Erklären von Softwarearchitekturdiagrammen und Remote-Bild-Assets
npx skills add kotot/vision@visionThemen und Funktionen