当原生视觉功能不可用时,将图像理解任务委派给可配置的兼容 OpenAI 的视觉模型。
通过轻量级 Python 脚本,为缺乏原生视觉功能的 Claude Code 环境带来图像识别、OCR 和视觉推理能力。
一个具有可衡量价值的专注工作流。
星标
3
分支
0
已更新
2026年8月8日
当你(当前模型)不具备原生视觉能力时,去查看和理解图像。每当需要查看、读取、描述、OCR 或对图像、截图、照片、图表、图解、UI 网页设计图或扫描页面的内容进行推理时,请使用此功能 —— 包括用户引用本地图像文件或图像 URL 且你无法亲自查看时。
在纯文本环境中,将图像处理任务(例如截图分析、OCR 文本提取、UI 网页设计图审阅和图解解释)委派给外部视觉模型。
从收据和扫描页面中提取文本和格式
调试通过截图捕获的软件错误日志
将可视化图表和图解转换为 markdown 表格
对比 UI 实现与设计网页设计图
解释软件架构图和远程图像资产
npx skills add kotot/vision@vision主题与功能