當原生視覺功能不可用時,將影像理解任務委託給可配置且相容 OpenAI 的視覺模型。

視覺

透過輕量級 Python 指令碼,為缺乏原生視覺功能的 Claude Code 環境帶來影像辨識、OCR 與視覺推理能力。

圖像分析資產處理代理工作流程
3 星標0 分支2026年8月8日 已更新檢視原始碼

技能影響

具備可衡量價值的專注工作流程。

星標

3

分支

0

已更新

2026年8月8日

關於視覺

當你(目前模型)沒有原生視覺功能時,檢視並理解圖像。每當你需要查看、讀取、描述、進行 OCR 或推理圖像、螢幕截圖、照片、圖表、圖示、UI 模擬畫面或掃描頁面的內容時,請使用此功能——包括使用者參照本機圖像檔案或圖像 URL 且你無法自行檢視時。

視覺能協助你做什麼

在純文字環境中,將圖像處理任務(例如螢幕截圖分析、OCR 文字萃取、UI 模擬畫面檢視與圖示解讀)委派給外部視覺模型。

使用光學字元辨識從圖像中轉錄文字,同時保留版面配置
分析並診斷來自應用程式螢幕截圖的錯誤訊息
從圖表與圖示中萃取結構化資料與表格
解讀使用者上傳的照片、UI 模擬畫面以及遠端圖像 URL

常見使用情境

01

從收據與掃描頁面中萃取文字與格式

02

對透過螢幕截圖擷取的軟體錯誤記錄進行除錯

03

將視覺圖表與圖示轉換為 Markdown 表格

04

比較 UI 實作與設計模擬畫面

05

解釋軟體架構圖與遠端圖像資源

快速入門

安裝指令

npx skills add kotot/vision@vision

標籤

主題與功能

#媒體分析#工作流程自動化#代理程式技能