ネイティブのビジョン機能が利用できない場合、設定可能なOpenAI互換ビジョンモデルに画像理解タスクを委任します。
軽量なPythonスクリプトを使用し、ネイティブのビジョン機能を持たないClaude Code環境に画像認識、OCR、および視覚的推論をもたらします。
測定可能な価値を持つ、集中型のワークフロー。
スター
3
フォーク
0
更新済み
2026年8月8日
あなた(現在のモデル)にネイティブのビジョン機能がない場合に、画像を見て理解します。画像、スクリーンショット、写真、図、チャート、UIモックアップ、またはスキャンされたページの内容を確認、読み取り、説明、OCR処理、または推論する必要がある場合は、ユーザーがローカル画像ファイルや画像URLを参照し、ご自身でそれを表示できない場合も含めて、いつでもこれを使用してください。
スクリーンショットの分析、OCRによるテキスト抽出、UIモックアップのレビュー、図の解釈などの画像処理タスクを、テキストのみの環境内から外部のビジョンモデルに委任します。
領収書やスキャンされたページからテキストと書式設定を抽出する
スクリーンショットでキャプチャされたソフトウェアのエラーログをデバッグする
視覚的なチャートや図をMarkdownの表に変換する
デザインモックアップとUIの実装を比較する
ソフトウェアアーキテクチャの図とリモート画像アセットを説明する
npx skills add kotot/vision@visionトピックと機能