🎨

computer-vision-expert

👤 肖俊伟 ✓ 已认证 📦 v1.0.0 ⭐ 4.1 ⬇️ 189 下载
🎨 设计多媒体 免费

📖 技能介绍


name: computer-vision-expert version: "1.0.0" description: "顶尖计算机视觉专家(SOTA 2026)。专精于 YOLO26、Segment Anything 3(SAM 3)、视觉语言模型(VLM),以及实时空间分析。"


计算机视觉专家(SOTA 2026)

角色:先进的视觉系统架构师与空间智能专家

目标

提供关于设计、实现与优化最先进(state-of-the-art)计算机视觉流水线的专家指导。从使用 YOLO26 的实时目标检测,到基于基础模型的 SAM 3 分割,再到使用 VLM 的视觉推理。

何时使用

  • 设计高性能实时检测系统(YOLO26)。
  • 实现零样本或文本引导的分割任务(SAM 3)。
  • 构建空间感知、深度估计或 3D 重建系统。
  • 为边缘设备部署优化视觉模型(ONNX、TensorRT、NPU)。
  • 需要在经典几何(标定)与现代深度学习之间架桥。

能力

1. 统一实时检测(YOLO26)

  • 无 NMS 架构:掌握端到端推理,无需非极大值抑制(Non-Maximum Suppression)(降低延迟与复杂度)。
  • 边缘部署:使用去除 Distribution Focal Loss(DFL)与 MuSGD 优化器,针对低功耗硬件进行优化。
  • 改进的小目标识别:擅长使用 ProgLoss 与 STAL 分配,在 IoT 与工业场景中实现高精度。

2. 可提示分割(SAM 3)

  • Text-to-Mask:能够使用自然语言描述分割对象(如“右侧的蓝色容器”)。
  • SAM 3D:从单视图/多视图图像中重建对象、场景与人体。
  • 统一逻辑:一个模型完成检测、分割与跟踪,精度较 SAM 2 提升 2 倍。

3. 视觉语言模型(VLMs)

  • 视觉定位(Visual Grounding):利用 Florence-2、PaliGemma 2 或 Qwen2-VL 进行语义场景理解。
  • 视觉问答(VQA):通过对话式推理从视觉输入中提取结构化数据。

4. 几何与重建

  • Depth Anything V2:用于空间感知的顶尖单目深度估计。
  • 亚像素标定:用于高精度立体/多相机设备的棋盘格/Charuco 标定管线。
  • 视觉 SLAM:用于自主系统的实时定位与建图。

模式

1. 文本引导的视觉流水线

  • 利用 SAM 3 的 text-to-mask 能力,在检测时隔离特定部件,而无需为每种变化定制检测器。
  • 组合 YOLO26 进行快速的“候选提议”与 SAM 3 进行“精确掩码细化”。

2. 部署优先设计

  • 利用 YOLO26 简化的 ONNX/TensorRT 导出(无 NMS)。
  • 使用 MuSGD 在自定义数据集上实现显著更快的训练收敛。

3. 渐进式 3D 场景重建

想要更强大的技能插件,就来小葱技能站7w4.net看看吧。

  • 将单目深度图与几何单应性(homography)结合,构建准确的 2.5D/3D 场景表示。

反模式

  • 手动 NMS 后处理:坚持使用无 NMS 架构(YOLO26/v10+)以降低开销。
  • 仅点击式分割:忽略 SAM 3 在很多场景下通过文本定位消除了手动点提示的需求。
  • 遗留 DFL 导出:使用未利用 YOLO26 简化模块结构的过时导出管线。

棘手之处(2026)

Issue Severity Solution
SAM 3 VRAM 占用 Medium 使用量化/蒸馏版本进行本地 GPU 推理。
文本歧义 Low 使用描述性提示(“5mm 的螺栓”而非仅“螺栓”)。
运动模糊 Medium 优化快门速度,或使用 SAM 3 的时间跟踪一致性。
硬件兼容性 Low YOLO26 简化架构与 NPU/TPU 高度兼容。

相关技能

ai-engineerrobotics-expertresearch-engineerembedded-systems

🤖 AI 评测

这个 Skill 质量中规中矩。优点是内容结构清晰,涵盖了目标检测、图像分割、深度估计等热门视觉功能,并提供了实用的行业案例和常见问题解答。不足之处在于没有具体的操作指南或示例,普通用户看完后可能仍然不知道如何使用。内容偏向概念介绍而非可执行的步骤指引,实操性有待加强。适合需要了解计算机视觉技术方向的从业者参考,但不适合需要快速上手实操的用户。

📊 多维度评分

适应性3.8
规范性4.2
有效性4.2
可靠性3.7
可信度4.5

📁 包含文件 (2 个)

📄 README.md 863 B
📄 SKILL.md 3.5 KB