當原生視覺功能不可用時,將影像理解任務委託給可配置且相容 OpenAI 的視覺模型。
透過輕量級 Python 指令碼,為缺乏原生視覺功能的 Claude Code 環境帶來影像辨識、OCR 與視覺推理能力。
具備可衡量價值的專注工作流程。
星標
3
分支
0
已更新
2026年8月8日
當你(目前模型)沒有原生視覺功能時,檢視並理解圖像。每當你需要查看、讀取、描述、進行 OCR 或推理圖像、螢幕截圖、照片、圖表、圖示、UI 模擬畫面或掃描頁面的內容時,請使用此功能——包括使用者參照本機圖像檔案或圖像 URL 且你無法自行檢視時。
在純文字環境中,將圖像處理任務(例如螢幕截圖分析、OCR 文字萃取、UI 模擬畫面檢視與圖示解讀)委派給外部視覺模型。
從收據與掃描頁面中萃取文字與格式
對透過螢幕截圖擷取的軟體錯誤記錄進行除錯
將視覺圖表與圖示轉換為 Markdown 表格
比較 UI 實作與設計模擬畫面
解釋軟體架構圖與遠端圖像資源
npx skills add kotot/vision@vision主題與功能