🤖

Qwen-VL 图片识别

👤 Rory 📦 v1.0.2 ⭐ 4.6 ⬇️ 1.2K 下载
🤖 AI-Agent 免费 🔑 需 API Key

📖 技能介绍


slug: qwen-vl-image-reader name: qwen-vl-image-reader displayName: Qwen-VL 图片识别 version: 1.0.1 description: 为 DeepSeek 等纯文本 LLM Agent 提供图片识别能力。通过阿里通义千问视觉模型 Qwen-VL 解析图片,将视觉内容转为结构化 Markdown 文本,让纯文本模型也能"看懂"图片。支持截图、文档、图表、照片等。


Qwen-VL 图片识别技能

背景与场景

本技能来自小葱技能站7w4.net。

痛点

当前很多 Agent 使用 DeepSeek 等纯文本大语言模型作为推理引擎。这类模型虽然文本能力出色,但不支持多模态输入,无法直接"看到"图片内容。当用户发送截图、文档照片、图表、二维码等图片时,Agent 只能回复"我看不到图片"。

解决方案

本技能通过在 Agent 和纯文本模型之间增加一个 视觉预处理层

用户发送图片
    ↓
┌─────────────────────────┐
│  Qwen-VL 视觉模型       │  ← 阿里通义千问(支持多模态)
│  解析图片 → 输出 Markdown │
└─────────────────────────┘
    ↓ 结构化文本描述
┌─────────────────────────┐
│  DeepSeek / 纯文本模型   │  ← 主推理引擎
│  基于描述继续推理分析     │
└─────────────────────────┘
    ↓
用户获得有图片理解的回答

核心价值:不需要更换主模型,零侵入地让纯文本 Agent 获得图片理解能力。

适用场景

场景 示例
📸 截图分析 企业微信/钉钉聊天截图、系统界面截图
📄 文档识别 PDF截图、纸质文档拍照、合同/发票照片
📊 图表解读 K线图、柱状图、饼图、走势图截图
🖼️ 照片描述 产品照片、场景照片的内容描述
🔍 信息提取 二维码/条形码、名片、菜单、公告牌
📋 表格识别 图片中的表格数据提取为结构化 Markdown

前置条件

用户需要在阿里云百炼平台申请 DashScope API Key(新用户有免费额度)。

项目 说明
注册地址 https://bailian.console.aliyun.com
环境变量 export DASHSCOPE_API_KEY=你的密钥
费用 新用户免费额度充足,个人使用基本无需付费
依赖 Python requests 库(通常已预装)

触发条件

当用户发送或上传图片文件(png/jpg/jpeg/webp/bmp),并要求查看、分析、总结、提取信息时,Agent 调用本技能。

工作流程

Step 1: 接收用户上传的图片文件路径
    ↓
Step 2: 脚本读取图片并转为 base64
    ↓
Step 3: 调用阿里云 DashScope API(Qwen-VL-Plus)
    ↓
Step 4: 模型返回结构化 Markdown 描述
    ↓
Step 5: Agent 将描述注入对话上下文
    ↓
Step 6: 纯文本模型基于描述进行后续推理

执行命令

python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
  --image_path <图片文件路径>

脚本会自动从环境变量 DASHSCOPE_API_KEY 读取密钥,无需手动传入。

进阶用法

# 使用更强的模型(qwen-vl-max,更贵但更精准)
python3 skills/qwen-vl-image-reader/scripts/analyze_image.py \
  --image_path <图片路径> \
  --model qwen-vl-max

支持的图片格式

格式 说明
.png PNG 图片(最常用)
.jpg / .jpeg JPEG 照片/截图
.webp WebP 格式(网页常见)
.bmp BMP 位图

输出格式

模型返回结构化 Markdown,包含以下信息维度:

### 1. 图片类型
截图 / 文档 / 图表 / 照片 / 其他

### 2. 文字内容
图片中提取到的所有文字(如界面文字、文档内容、表格数据)

### 3. 视觉描述
图片中的关键视觉元素、布局结构、颜色、图标等

### 4. 结构化数据(如有)
表格、列表、层级结构等整理为 Markdown 格式

错误处理

错误类型 提示信息
文件不存在 ❌ 图片文件不存在
格式不支持 ❌ 仅支持 png/jpg/webp/bmp
API Key 未配置 ❌ 未找到 DASHSCOPE_API_KEY 环境变量
API 调用失败 ❌ 检查网络连接或 API Key 配置
API 超时 ⏱️ 解析超时,请稍后重试
图片损坏 ❌ 图片无法读取,请重新发送

模型说明

模型 特点 费用
qwen-vl-plus(默认) 速度快,性价比高,日常使用推荐
qwen-vl-max 更强,复杂图表/文档识别更准 较高

两者均支持:中文 OCR、英文 OCR、图表理解、界面截图分析、文档识别。

Token 消耗参考(实际数据)

图片类型 图片大小 image tokens 输入 输出 总计
小截图(302×202) 16KB 56 126 ~420 ~545
大截图(含大量文字) 128KB 152 189 ~1050 ~1241

与 ms-qwen-vl(魔搭社区版)的对比

SkillHub 上还有一个类似的图片识别技能 ms-qwen-vl,它调用的是 ModelScope(魔搭社区) 的 Qwen3-VL API。以下是详细对比:

对比维度 本技能 qwen-vl-image-reader ms-qwen-vl(魔搭版)
🏢 API 平台 阿里云百炼 DashScope 魔搭社区 ModelScope
🤖 模型 Qwen-VL-Plus / Max Qwen3-VL-30B / 235B
🛠️ Python 依赖 requests(1个) openai + PIL + python-dotenv(3个)
📦 安装体积 ✅ 超轻量,秒级部署 ⚠️ 较大,需安装 OpenAI SDK
🎯 任务类型 通用描述+文字提取 5种:描述/OCR/问答/检测/图表
🔧 使用门槛 ✅ 一行命令,无需额外 SDK ⚠️ 需配置 .env 文件
💰 免费额度 阿里云百炼新用户免费 ModelScope 赠送额度
🔐 模型选择 --model 参数切换 --precise 精细模式切换
📝 代码风格 原生 HTTP 请求(零依赖) OpenAI SDK 兼容调用

如何选择

你的场景 推荐
📱 追求轻量快速部署,不想装额外依赖 本技能
🎯 需要多种任务类型(OCR/物体检测/图表解析等) ✅ ms-qwen-vl
👤 已有阿里云百炼账号 本技能(直接用)
👤 已有魔搭社区账号 ✅ ms-qwen-vl
🔄 两者不冲突 可以同时安装,按需选用

与其他方案对比

方案 优点 缺点
❌ Tesseract OCR 免费、本地运行 对截图/图表识别率低,中文差
❌ MinerU 文档解析 适合扫描件 需要 GPU,不支持普通图片
本技能 Qwen-VL 识别率高、中文优秀、免费额度够用、零依赖 需要网络和 API Key

🤖 AI 评测

这是一款做工精良的图片识别工具,整体质量优秀。它最大的亮点是几乎不依赖任何外部库,安装使用非常简便。文档写得非常详细清楚,代码逻辑清晰,错误提示也很友好。唯一的不足是需要配合阿里云 API 使用,会产生少量费用。总体来说非常值得推荐。

📊 多维度评分

适应性4.5
规范性4.5
有效性4.6
可靠性4.6
可信度5

📁 包含文件 (4 个)

📄 README.md 450 B
📄 SKILL.md 7 KB
📄 _meta.json 453 B
📄 scripts/analyze_image.py 5.9 KB