Image Vision

👤 duchenyu 📦 v1.0.5 ⭐ 4.5 ⬇️ 384 下载
🤖 AI-Agent 免费

📖 技能介绍


name: image-vision description: 本地图片视觉理解桥接。当用户明确要求分析、描述或理解图片内容时,调用本地 Ollama 视觉模型(qwen3.5:4b)读取图片并以文字描述返回,让不具备多模态能力的推理模型也能"看见"图片。 trigger: - 用户明确要求分析、描述、阅读、理解图片内容 - 用户发送了图片文件并询问相关内容 permissions: shell: true files: true network: true privacy: > 图片文件会被读取并以 base64 编码发送到本地 Ollama API(127.0.0.1:11434)。 所有处理在本机完成,数据不离开你的设备。


Image Vision Bridge

本地视觉桥接 —— 当用户明确要求分析图片时,调用 Ollama 本地视觉模型(qwen3.5:4b / qwen3.5:9b)读图并返回文字描述。

来源于7w4.net。

⚠️ 隐私提示: 图片内容会被读取并发送到本地 Ollama 服务进行处理。所有数据仅在本机传输,不上传云端。

使用方式

python scripts/describe_image.py "<图片路径>"

可选参数

参数 说明 默认值
--model 视觉模型名 qwen3.5:4b
--prompt 自定义分析指令 详细描述所有细节

模型选择

  • qwen3.5:4b (~3.4GB) — 轻量化,首次加载约30秒,后续秒级响应。适合日常读图。
  • qwen3.5:9b (~6.6GB) — 更高质量,描述更准确细腻。适合需要精准理解的场景。

自定义 prompt 示例

# 提取图中文字
--prompt "请逐字提取图片中所有文字内容,不要遗漏任何文字。"

# 分析 UI 界面
--prompt "这是一个软件界面截图,请分析其布局、按钮、输入框等交互元素。"

# 提取代码
--prompt "完整提取截图中的代码,保留缩进和格式。"

工作流程

  1. 用户明确要求分析图片 → 检测到图片路径
  2. 脚本将图片 base64 编码 → 发送到本地 Ollama API(127.0.0.1)
  3. qwen3.5 视觉模型分析图片 → 返回文字描述
  4. 描述注入对话 → 基于描述继续完成任务

前置条件

  • ✅ Ollama 已安装并运行
  • ✅ qwen3.5:4b 已拉取(已就绪)
  • ✅ Python 3.9+

故障排除

如果 Ollama 模型崩溃("llama-server process has terminated"),需要重启 Ollama 服务:

# macOS / Linux
pkill ollama && ollama serve &

# Windows (PowerShell)
Get-Process -Name "ollama*" -ErrorAction SilentlyContinue | Stop-Process -Force
Start-Process ollama -ArgumentList "serve" -WindowStyle Hidden

🤖 AI 评测

这是一款高质量的本地图片理解工具,隐私保护做得很好——图片不会上传云端,完全在本地处理。文档清晰易懂,安装使用都很简单,兼容多种视觉模型。它的最大亮点是让不支持图片的 AI 助手也能「看懂」截图和照片。不过依赖 Ollama 服务运行,首次配置稍需步骤;对剪贴板截图工具的依赖库处理不够稳定。建议:安装前确认 Ollama 已就绪,Windows 用户可能需要额外配置环境。总体值得推荐,尤其适合注重数据隐私的开发者。

📊 多维度评分

适应性4.2
规范性4.4
有效性4.5
可靠性4.4
可信度5

📁 包含文件 (6 个)

📄 README.md 16.1 KB
📄 SKILL.md 2.5 KB
📄 _meta.json 138 B
📄 scripts/clip_snap.py 4.3 KB
📄 scripts/describe_image.py 3.3 KB
📄 skill-card.md 2.5 KB