기본 시각 기능을 사용할 수 없을 때 이미지 이해 작업을 구성 가능한 OpenAI 호환 비전 모델에 위임합니다.

비전

가벼운 파이썬 스크립트를 통해 기본 비전 기능이 없는 Claude Code 환경에 이미지 인식, OCR, 시각적 추론 기능을 제공합니다.

이미지 분석에셋 처리에이전트 워크플로
3 별표0 포크2026년 8월 8일 업데이트됨소스 보기

스킬 영향력

측정 가능한 가치를 제공하는 집중된 워크플로.

별표

3

포크

0

업데이트됨

2026년 8월 8일

비전 소개

현재 모델에 네이티브 시각 기능이 없을 때 이미지를 보고 이해합니다. 사용자가 로컬 이미지 파일이나 이미지 URL을 참조하고 직접 볼 수 없는 경우를 포함하여 이미지, 스크린샷, 사진, 다이어그램, 차트, UI 목업 또는 스캔된 페이지의 내용을 살펴보거나, 읽거나, 설명하거나, OCR을 수행하거나, 추론해야 할 때 언제든지 사용하세요.

비전이 도울 수 있는 작업

텍스트 전용 환경 내에서 스크린샷 분석, OCR 텍스트 추출, UI 목업 검토, 다이어그램 해석과 같은 이미지 처리 작업을 외부 비전 모델에 위임합니다.

레이아웃을 유지하면서 광학 문자 판독(OCR)을 통해 이미지에서 텍스트 추출
애플리케이션 스크린샷에서 오류 메시지 분석 및 진단
차트 및 다이어그램에서 구조화된 데이터 및 표 추출
사용자가 업로드한 사진, UI 목업 및 원격 이미지 URL 해석

일반적인 사용 사례

01

영수증 및 스캔된 페이지에서 텍스트 및 서식 추출

02

스크린샷으로 캡처된 소프트웨어 오류 로그 디버깅

03

시각적 차트 및 다이어그램을 마크다운 표로 변환

04

디자인 목업과 UI 구현 비교

05

소프트웨어 아키텍처 다이어그램 및 원격 이미지 에셋 설명

빠른 시작

설치 명령어

npx skills add kotot/vision@vision

태그

주제 및 기능

#미디어 분석#워크플로 자동화#에이전트 스킬