ネイティブのビジョン機能が利用できない場合、設定可能なOpenAI互換ビジョンモデルに画像理解タスクを委任します。

ビジョン

軽量なPythonスクリプトを使用し、ネイティブのビジョン機能を持たないClaude Code環境に画像認識、OCR、および視覚的推論をもたらします。

画像解析アセット処理エージェントワークフロー
3 スター0 フォーク2026年8月8日 更新済みソースを表示

スキルの影響

測定可能な価値を持つ、集中型のワークフロー。

スター

3

フォーク

0

更新済み

2026年8月8日

ビジョンについて

あなた(現在のモデル)にネイティブのビジョン機能がない場合に、画像を見て理解します。画像、スクリーンショット、写真、図、チャート、UIモックアップ、またはスキャンされたページの内容を確認、読み取り、説明、OCR処理、または推論する必要がある場合は、ユーザーがローカル画像ファイルや画像URLを参照し、ご自身でそれを表示できない場合も含めて、いつでもこれを使用してください。

ビジョンでできること

スクリーンショットの分析、OCRによるテキスト抽出、UIモックアップのレビュー、図の解釈などの画像処理タスクを、テキストのみの環境内から外部のビジョンモデルに委任します。

レイアウトを維持しながら、OCR(光学文字認識)を使用して画像からテキストを書き起こす
アプリケーションのスクリーンショットからエラーメッセージを分析・診断する
チャートや図から構造化データや表を抽出する
ユーザーがアップロードした写真、UIモックアップ、リモート画像URLを解釈する

一般的なユースケース

01

領収書やスキャンされたページからテキストと書式設定を抽出する

02

スクリーンショットでキャプチャされたソフトウェアのエラーログをデバッグする

03

視覚的なチャートや図をMarkdownの表に変換する

04

デザインモックアップとUIの実装を比較する

05

ソフトウェアアーキテクチャの図とリモート画像アセットを説明する

クイックスタート

インストールコマンド

npx skills add kotot/vision@vision

タグ

トピックと機能

#メディア分析#ワークフロー自動化#エージェントスキル