当原生视觉功能不可用时,将图像理解任务委派给可配置的兼容 OpenAI 的视觉模型。

视觉

通过轻量级 Python 脚本,为缺乏原生视觉功能的 Claude Code 环境带来图像识别、OCR 和视觉推理能力。

图像分析资产处理智能体工作流
3 星标0 分支2026年8月8日 已更新查看源码

技能影响

一个具有可衡量价值的专注工作流。

星标

3

分支

0

已更新

2026年8月8日

关于 Vision

当你(当前模型)不具备原生视觉能力时,去查看和理解图像。每当需要查看、读取、描述、OCR 或对图像、截图、照片、图表、图解、UI 网页设计图或扫描页面的内容进行推理时,请使用此功能 —— 包括用户引用本地图像文件或图像 URL 且你无法亲自查看时。

Vision 可以帮您做什麽

在纯文本环境中,将图像处理任务(例如截图分析、OCR 文本提取、UI 网页设计图审阅和图解解释)委派给外部视觉模型。

使用光学字符识别技术转录图像中的文本,同时保留布局
分析并诊断来自应用程序截图的错误消息
从图表和图解中提取结构化数据和表格
解释用户上传的照片、UI 网页设计图和远程图像 URL

常见用例

01

从收据和扫描页面中提取文本和格式

02

调试通过截图捕获的软件错误日志

03

将可视化图表和图解转换为 markdown 表格

04

对比 UI 实现与设计网页设计图

05

解释软件架构图和远程图像资产

快速入门

安装命令

npx skills add kotot/vision@vision

标签

主题与功能

#媒体分析#工作流自动化#智能体技能