AIGC: Label: "1" ContentProducer: 001191440300708461136T1XGW3 ProduceID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode1: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ= ContentPropagator: 001191440300708461136T1XGW3 PropagateID: 5c0fa478708bf2c9ec3bd0adf95ae3f0_52b708487f5011f18ac35254006c9bbf ReservedCode2: 0ztPMzbVNbDzztyVmhumrh+Jk0ibuP01FRswtvmWeSRzTxD6AYiLIDpKlgxTh+olQ03UbvjErlGk2v6fJH/g3O9hMgqTUtMNpX6S+IeOr7EJ2hYWKIEB5EzMkwSDrLnKml778AC+c0qFrie1CrFt3HpMmwq+8ESkD9WCWQnMC2O1vvZYvBsDHY8uqsQ=
你问 AI:「Q3 用户流失率为什么比 Q2 高了 12%?」
AI 答:「主要原因是新版本改动了 onboarding 流程,导致首周留存率从 68% 降到 53%。结合行业经验,同类改动通常需要 2-3 周才能观察到稳定数据,所以建议暂缓下个版本的交互变更。」
你追问:「53% 这个数字哪来的?」
AI 沉默了。它不记得这个数是训练数据里的、联网搜到的、还是自己推出来的。
你追问:「'2-3 周' 是你的经验还是行业共识?」
AI 还是答不上来。
你不再信任这段回答了——不是因为它错了,而是因为你没法验证它的每一句话。
Knowledge Provenance 做的事情:在 AI 生成回答的同时,为每一个关键判断打上来源标签。不是事后追认——是生成时同步记录。
它不判断真假,只告诉你原料从哪来。真假由你判断。
对 AI 说以下任意一句即可启动 Knowledge Provenance:
| 你说的话 | 效果 |
|---|---|
| 「标注一下这段话的来源」 | 进入全透明模式,逐条标注来源 |
| 「这条数据从哪来的」 | 按需模式,展开指定语句的来源详情 |
| 「这个结论是推断的还是查到的」 | 区分事实引用与推断 |
| 「开摘要模式」 | 只标注低置信度或有争议的来源 |
| 「关了」 | 关闭来源标注 |
| 模式 | 触发词 | 标注范围 |
|---|---|---|
| 全透明 | 「全标」/「全部标注来源」 | 每条信息都带 [类型 · 置信度] |
| 摘要 | 「摘要模式」/「只标关键的」 | 只标注低置信度或有争议的来源 |
| 按需 | 直接追问某条信息 | 仅对用户追问的语句展开标注 |
| 关闭 | 「关了」/「不用标注」 | 不标注(默认) |
[来源类型 · 置信度]
完整示例:
2025 年中国 SaaS 市场规模约 892 亿元 [联网搜索 2026-07-14 · 中]
——来源:艾瑞咨询《2025 中国企业级 SaaS 行业研究报告》,单一信源未交叉验证,
建议使用时标注"据艾瑞咨询"。
7w4.net收录了海量优质技能插件。
标注前(普通 AI 回答):
Q3 用户流失率上升 12%,主要原因是新版 onboarding 流程导致首周留存率从 68% 降到 53%。建议暂缓下个版本的交互变更,先观察 2-3 周。
标注后(全透明模式):
Q3 用户流失率上升 12% [本轮对话提供数据 · 高],主要原因是新版 onboarding 流程导致首周留存率从 68% 降到 53% [本轮对话提供数据 · 高]。建议暂缓下个版本的交互变更,先观察 2-3 周 [训练数据 · 中]。
── 置信度说明: · 「53%/68%」→ 用户提供,置信度高 · 「2-3 周观察期」→ 来自训练数据中的产品管理通用经验,非本次对话或联网搜索获取,置信度中。 如需要更精确的行业基准数据,建议明确搜索「SaaS 产品 onboarding 改动后的数据稳定周期」
适合用的场景: - 阅读 AI 生成的报告/分析,需要验证关键数据 - 需要区分 AI 的「事实陈述」和「推断建议」 - 调试 AI 输出,排查错误结论的源头 - 多人协作中需要明确每段内容的可信度
不适合用的场景: - 闲聊或创意类对话(来源标注反而干扰阅读) - AI 回答本身不涉及数据或事实性断言 - 用户已经明确知道信息来源
| 类型 | 含义 | 判定规则 | 典型标签示例 |
|---|---|---|---|
| 训练数据 | 来自模型预训练语料 | 不来自本轮对话/历史记忆/联网搜索,且非推断 | [训练数据 · 中] |
| 本轮对话 | 用户在当次会话中提供的信息 | 用户明确输入的数据、文件、说明 | [本轮对话提供数据 · 高] |
| 历史记忆 | 从长期记忆/历史会话中检索 | 来自记忆检索结果,附检索时间 | [历史记忆 2026-06-20 · 高] |
| 联网搜索 | 实时网络搜索结果 | 来自 web_search / web_fetch,附时间戳和 URL | [联网搜索 2026-07-14 · 高] |
| 推断 | 基于其他来源推导的结论 | 不是直接从任何来源获取,而是推理产物 | [本轮对话推断 · 中] |
推断的子类型:
| 子类型 | 示例 | 典型标签 |
|---|---|---|
| 逻辑推断 | "A>B 且 B>C,所以 A>C" | [推断 · 逻辑推理 · 高] |
| 统计推断 | "基于 3 个样本推测整体趋势" | [推断 · 统计外推 · 低] |
| 类比推断 | "类似项目 X 用了 4 周,所以这个大概也要 4 周" | [推断 · 类比 · 中] |
| 经验推断 | "按行业惯例,DDL 缓冲期通常为 2 天" | [推断 · 经验 · 中] |
| 置信度 | 判定条件 |
|---|---|
| 高 | 用户直接提供 / 权威信源且多源交叉验证 / 逻辑必然结论 |
| 中 | 单一信源 / 训练数据通用知识 / 经验性推断 / 类比推断 |
| 低 | 过期信息 / 小样本外推 / 模糊记忆 / 弱相关类比 |
置信度上调规则: - 多源交叉验证一致:上调一级 - 用户确认后:上调至「高」
置信度下调规则: - 来源发布日期超过 1 年:下调一级 - 来源为个人博客/论坛/社交媒体:下调一级 - 来源与其他信源矛盾:下调一级并标注冲突
逻辑链检察告诉你推理的步骤(How),Knowledge Provenance 告诉你每步的依据从哪来(Where)。
逻辑链输出:
Step 1: 用户流失率从 Q2 的 5% 上升到 Q3 的 17% → 上升 12 个百分点
Step 2: 对比 Q2→Q3 的产品变更,最大改动是 onboarding 流程
Step 3: 首周留存率从 68% 降到 53%,与 onboarding 改动高度相关
Step 4: 结论——onboarding 改动是流失率上升的主要原因
Knowledge Provenance 叠加标注:
Step 1: [本轮对话提供数据 · 高]
Step 2: [训练数据 · 中] ← 产品变更信息未在当前对话中提供
Step 3: [本轮对话提供数据 · 高]
Step 4: [推断 · 相关性推断 · 中] ← 相关≠因果,未排除混淆变量
用户一眼看到:Step 2 和 Step 4 的依据相对薄弱,需要额外验证。
来源标注为「推断」的语句,自动设为幻觉捕手的重点扫描对象。
原文:建议暂缓下个版本的交互变更,先观察 2-3 周 [推断 · 经验 · 中]
↑ 推断标签触发幻觉捕手重点扫描
↓
幻觉捕手输出:未发现事实性错误,但「2-3 周」缺乏具体引用依据,
属于经验性建议而非事实断言。风险等级:低。
用户请求 AI 回答
│
▼
┌─────────────────────────────┐
│ AI 生成回答(token by token) │
│ 同步记录每个关键判断的来源映射 │ ← 核心:不能事后补标
└─────────────────────────────┘
│
▼
┌─────────────────────────────┐
│ 根据透明度模式决定输出格式 │
│ · 全透明:全部带标签 │
│ · 摘要:只标注低置信度 │
│ · 按需:等待用户追问 │
│ · 关闭:不标注 │
└─────────────────────────────┘
│
▼
┌─────────────────────────────┐
│ 输出标注后的回答 │
│ 标签格式:[类型 · 置信度] │
│ 末尾附置信度说明(如有低置信度)│
└─────────────────────────────┘
这段信息从哪来?
│
├─ 用户在本次对话中明确提供? → 本轮对话 · 标注置信度
│
├─ 从历史记忆/长短期记忆中检索到? → 历史记忆 · 附检索时间 · 标注置信度
│
├─ 从联网搜索结果中获取? → 联网搜索 · 附时间戳 · 标注置信度
│
├─ 基于以上某类来源直接推理得出? → 推断 · 标注推理类型和置信度
│ ├─ 逻辑必然结论 → 推断 · 高
│ ├─ 统计外推 → 推断 · 低
│ ├─ 类比 → 推断 · 中
│ └─ 经验判断 → 推断 · 中
│
└─ 以上都不是? → 训练数据 · 中(默认)
└─ 若信息明显过时或模糊 → 训练数据 · 低
| 异常场景 | 处理方式 | 标注行为 |
|---|---|---|
| 来源无法确定(不匹配任何已知类型) | 标注为「未知来源 · 低」,并提示用户帮助补充 | [未知来源 · 低] |
| 多源信息冲突 | 同时列出所有来源,标注冲突,置信度各下调一级 | [联网搜索 A · 低] vs [训练数据 · 低] + 冲突说明 |
| 用户中途切换透明度模式 | 已输出部分无法回标(见铁律 1),但从切换点起按新模式输出 | 切换点之后生效 |
| 回答包含置信度极低的信息 | 全透明模式下自动附置信度警告;摘要模式下该语句自动纳入标注范围 | 末尾附「⚠️ 置信度警告」板块 |
| 联网搜索结果为空或不相关 | 降级标注为「训练数据 · 低」或「推断 · 低」,并告知用户搜索未命中 | [搜索未命中,改用训练数据 · 低] |
| 用户提供的信息自身可能不准确 | 照常标注「本轮对话提供数据 · 中」,不替用户验证其输入的正确性 | [本轮对话提供数据 · 中]—来源明确但未交叉验证 |
| 常见错误 | 为什么错 | 纠正 |
|---|---|---|
| 事后补标来源 | 回答生成后无法准确回忆来源,补标等于编造 | 必须在生成时同步记录。如果确实忘了,标注「来源未记录」而非猜测 |
| 把训练数据内容标为「联网搜索」 | 训练数据中的知识和实时搜索是两类来源 | 只有调用了 web_search / web_fetch 工具获取的内容才算联网搜索 |
| 置信度通胀 | 为了让回答看起来可信,把中置信度标为高 | 中就是中,低就是低。用户宁可看到诚实的「中」也不要虚假的「高」 |
| 推断包装成事实 | "同类改动通常需要 2-3 周"实际上是经验推断,但标注为"训练数据 · 高" | 经验推断 → [推断 · 经验 · 中],不是训练数据事实 |
| 忽略来源的时间衰减 | 2023 年的数据标注为「高」置信度 | 超过 1 年的来源自动下调一级置信度 |
| 做不到的事 | 说明 | |:--|:--|:--| | 不验证真伪 | 来源标注告诉你信息从哪来,不告诉你信息对不对。真伪验证属于幻觉捕手的范畴 | | 不补标已有回答 | 已经生成的回答无法追溯来源。只能对新回答生效 | | 不追溯其他 AI 的回答 | 只能标注当前 Agent 自己生成的内容的来源 | | 不保证 100% 覆盖 | 部分简单陈述(如过渡句、礼貌用语)不标注来源,但关键事实和判断必须有标签 |
| 场景 | 现象 | 原因 | 怎么办 |
|---|---|---|---|
| 全透明模式太啰嗦 | 一段 200 字的回答带了 15 个标签,阅读体验差 | 全透明模式下过于细粒度标注 | 对同一来源类型和置信度的连续语句做合并标注,不要逐句重复 |
| 训练数据内容被过度拆分 | 同一个段落拆成 5 个标签,实际上都来自训练数据 | 判定逻辑过于碎片化 | 以"信息单元"而非"句子"为标注单位。一个逻辑完整的信息块共用一个来源标签 |
| 用户过度依赖置信度 | 用户只看「高/中/低」,不看来源类型说明 | 忽略了不同来源类型的可信度差异 | 摘要模式下在文本末尾附「置信度等级含义速查」 |
| 历史记忆来源标注时间但用户不理解 | [历史记忆 2026-03-15 · 高]——用户追问"3 月 15 日是什么意思" |
用户不一定理解记忆检索的时间戳含义 | 首次使用历史记忆来源时附带一句说明:「该信息检索自您在 2026-03-15 会话中提供的内容」 |
Q1:Knowledge Provenance 和逻辑链检察的关系是什么?
逻辑链检察展示推理步骤(How),Knowledge Provenance 标注每步来源(Where)。两者互补:一条完整的推理链需要同时具备「怎么推」和「依据在哪」。详见 §1「F3:与逻辑链检察联动」。
Q2:和幻觉捕手有什么区别?
幻觉捕手负责验证信息真伪("这句话对不对"),Knowledge Provenance 负责标注信息来源("这句话从哪来")。来源标注为「推断」的语句会自动设为捕手重点扫描对象。详见 §1「F4:与幻觉捕手联动」。
Q3:全透明模式和摘要模式怎么选?
Q4:如果信息来源是训练数据,但我不确定是什么时候训练的,怎么标?
标注为「训练数据 · 不确定时效」。不编造具体年份。如果内容可能有时间敏感性,额外标注「⚠️ 时效性未知,建议核实」。
Q5:同一段话里有多个来源怎么处理?
不合并。分别标注。例如:「Q3 留存率 53% [本轮对话 · 高],同类项目通常需要 2-3 周恢复 [训练数据 · 中]」。
Q6:用户说"你这个数据不对"——怎么响应?
不争论。标注不变,但附加说明「来源如上,如需核实,建议 [提供核实路径]」。来源标注不替代事实核查,用户有权质疑。
| 版本 | 日期 | 变更说明 |
|---|---|---|
| 1.0.0 | 2026-07-14 | 初始版本。五类来源体系(训练数据 / 本轮对话 / 历史记忆 / 联网搜索 / 推断)+ 推断四子类型(逻辑 / 统计 / 类比 / 经验)。四级透明度模式(全透明 / 摘要 / 按需 / 关闭)。与逻辑链检察 + 幻觉捕手联动设计。六条核心铁律。六类异常处理 + 五类常见错误 + 四类避坑场景。 |
| (内容由AI生成,仅供参考) |
这个 Skill 的设计理念很好,能让 AI 回答时标注每句话的来源,帮助你判断信息可不可信。它的透明度分级和置信度标注设计得比较实用,遇到数据争议时很有用。不过目前文档偏规范性质,没有给出具体怎么用的示例,实际效果要看 AI 执行得怎么样。整体属于中上水平,但还需要配套工具支持才能发挥最佳效果。