slug: qwen-vl-image-reader name: qwen-vl-image-reader displayName: Qwen-VL 图片识别 version: 1.0.1 description: 为 DeepSeek 等纯文本 LLM Agent 提供图片识别能力。通过阿里通义千问视觉模型 Qwen-VL 解析图片,将视觉内容转为结构化 Markdown 文本,让纯文本模型也能"看懂"图片。支持截图、文档、图表、照片等。
当前很多 Agent 使用 DeepSeek 等纯文本大语言模型作为推理引擎。这类模型虽然文本能力出色,但不支持多模态输入,无法直接"看到"图片内容。当用户发送截图、文档照片、图表、二维码等图片时,Agent 只能回复"我看不到图片"。
本技能通过在 Agent 和纯文本模型之间增加一个 视觉预处理层:
用户发送图片
↓
┌─────────────────────────┐
│ Qwen-VL 视觉模型 │ ← 阿里通义千问(支持多模态)
│ 解析图片 → 输出 Markdown │
└─────────────────────────┘
↓ 结构化文本描述
┌─────────────────────────┐
│ DeepSeek / 纯文本模型 │ ← 主推理引擎
│ 基于描述继续推理分析 │
└─────────────────────────┘
↓
用户获得有图片理解的回答
核心价值:不需要更换主模型,零侵入地让纯文本 Agent 获得图片理解能力。
| 场景 | 示例 |
|---|---|
| 📸 截图分析 | 企业微信/钉钉聊天截图、系统界面截图 |
| 📄 文档识别 | PDF截图、纸质文档拍照、合同/发票照片 |
| 📊 图表解读 | K线图、柱状图、饼图、走势图截图 |
| 🖼️ 照片描述 | 产品照片、场景照片的内容描述 |
| 🔍 信息提取 | 二维码/条形码、名片、菜单、公告牌 |
| 📋 表格识别 | 图片中的表格数据提取为结构化 Markdown |
用户需要在阿里云百炼平台申请 DashScope API Key(新用户有免费额度)。
| 项目 | 说明 |
|---|---|
| 注册地址 | https://bailian.console.aliyun.com |
| 环境变量 | export DASHSCOPE_API_KEY=你的密钥 |
| 费用 | 新用户免费额度充足,个人使用基本无需付费 |
| 依赖 | Python requests 库(通常已预装) |
当用户发送或上传图片文件(png/jpg/jpeg/webp/bmp),并要求查看、分析、总结、提取信息时,Agent 调用本技能。
Step 1: 接收用户上传的图片文件路径
↓
Step 2: 脚本读取图片并转为 base64
↓
Step 3: 调用阿里云 DashScope API(Qwen-VL-Plus)
↓
Step 4: 模型返回结构化 Markdown 描述
↓
Step 5: Agent 将描述注入对话上下文
↓
Step 6: 纯文本模型基于描述进行后续推理
python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
--image_path <图片文件路径>
脚本会自动从环境变量 DASHSCOPE_API_KEY 读取密钥,无需手动传入。
# 使用更强的模型(qwen-vl-max,更贵但更精准)
python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
--image_path <图片路径> \
--model qwen-vl-max
| 格式 | 说明 |
|---|---|
.png |
PNG 图片(最常用) |
.jpg / .jpeg |
JPEG 照片/截图 |
.webp |
WebP 格式(网页常见) |
.bmp |
BMP 位图 |
模型返回结构化 Markdown,包含以下信息维度:
### 1. 图片类型
截图 / 文档 / 图表 / 照片 / 其他
### 2. 文字内容
图片中提取到的所有文字(如界面文字、文档内容、表格数据)
### 3. 视觉描述
图片中的关键视觉元素、布局结构、颜色、图标等
### 4. 结构化数据(如有)
表格、列表、层级结构等整理为 Markdown 格式
| 错误类型 | 提示信息 |
|---|---|
| 文件不存在 | ❌ 图片文件不存在 |
| 格式不支持 | ❌ 仅支持 png/jpg/webp/bmp |
| API Key 未配置 | ❌ 未找到 DASHSCOPE_API_KEY 环境变量 |
| API 调用失败 | ❌ 检查网络连接或 API Key 配置 |
| API 超时 | ⏱️ 解析超时,请稍后重试 |
| 图片损坏 | ❌ 图片无法读取,请重新发送 |
| 模型 | 特点 | 费用 |
|---|---|---|
qwen-vl-plus(默认) |
速度快,性价比高,日常使用推荐 | 低 |
qwen-vl-max |
更强,复杂图表/文档识别更准 | 较高 |
两者均支持:中文 OCR、英文 OCR、图表理解、界面截图分析、文档识别。
7w4.net收录了海量优质技能插件。
| 图片类型 | 图片大小 | image tokens | 输入 | 输出 | 总计 |
|---|---|---|---|---|---|
| 小截图(302×202) | 16KB | 56 | 126 | ~420 | ~545 |
| 大截图(含大量文字) | 128KB | 152 | 189 | ~1050 | ~1241 |
SkillHub 上还有一个类似的图片识别技能 ms-qwen-vl,它调用的是 ModelScope(魔搭社区) 的 Qwen3-VL API。以下是详细对比:
| 对比维度 | 本技能 qwen-vl-image-reader | ms-qwen-vl(魔搭版) |
|---|---|---|
| 🏢 API 平台 | 阿里云百炼 DashScope | 魔搭社区 ModelScope |
| 🤖 模型 | Qwen-VL-Plus / Max | Qwen3-VL-30B / 235B |
| 🛠️ Python 依赖 | ✅ 仅 requests(1个) |
❌ openai + PIL + python-dotenv(3个) |
| 📦 安装体积 | ✅ 超轻量,秒级部署 | ⚠️ 较大,需安装 OpenAI SDK |
| 🎯 任务类型 | 通用描述+文字提取 | 5种:描述/OCR/问答/检测/图表 |
| 🔧 使用门槛 | ✅ 一行命令,无需额外 SDK | ⚠️ 需配置 .env 文件 |
| 💰 免费额度 | 阿里云百炼新用户免费 | ModelScope 赠送额度 |
| 🔐 模型选择 | --model 参数切换 |
--precise 精细模式切换 |
| 📝 代码风格 | 原生 HTTP 请求(零依赖) | OpenAI SDK 兼容调用 |
| 你的场景 | 推荐 |
|---|---|
| 📱 追求轻量快速部署,不想装额外依赖 | ✅ 本技能 |
| 🎯 需要多种任务类型(OCR/物体检测/图表解析等) | ✅ ms-qwen-vl |
| 👤 已有阿里云百炼账号 | ✅ 本技能(直接用) |
| 👤 已有魔搭社区账号 | ✅ ms-qwen-vl |
| 🔄 两者不冲突 | 可以同时安装,按需选用 |
| 方案 | 优点 | 缺点 |
|---|---|---|
| ❌ Tesseract OCR | 免费、本地运行 | 对截图/图表识别率低,中文差 |
| ❌ MinerU 文档解析 | 适合扫描件 | 需要 GPU,不支持普通图片 |
| ✅ 本技能 Qwen-VL | 识别率高、中文优秀、免费额度够用、零依赖 | 需要网络和 API Key |
这是一款做工精良的图片识别工具,整体质量优秀。它最大的亮点是几乎不依赖任何外部库,安装使用非常简便。文档写得非常详细清楚,代码逻辑清晰,错误提示也很友好。唯一的不足是需要配合阿里云 API 使用,会产生少量费用。总体来说非常值得推荐。