| 被测模型 × 配置 | 归因质量 judge 1–5 | 方法论增益 Δjudge |
机制编造率 越低越好 | 异常定位 精确率 | 正常日 假阳性 |
|---|---|---|---|---|---|
| DeepSeek V4 Flash +方法论 | 3.05 | +0.55 | 22.7% | 47.6% | 1/10 |
| 裸模型 | 2.50 | 31.8% | 22.2% | 3/10 | |
| GLM-5.2 +方法论 | 3.82 | +0.68 | 13.6% | 39.5% | 2/10 |
| 裸模型 | 3.14 | 22.7% | 40.3% | 4/10 | |
| Kimi K3 +方法论 | 4.50 | +1.09 ▲ | 4.5% | 47.7% | 3/10 |
| 裸模型 | 3.41 | 18.2% | 40.2% | 3/10 |
口径:裁判恒为 DeepSeek 系(温度 0),对 Kimi K3 / GLM 属跨家打分——K3 拿冠军是"别人家模型给它打的分",比自评更硬。DeepSeek / GLM 走免费量化通道,K3 走官方付费 API。n=22,单轮有波动,看趋势不看单点。
关于「异常定位精确率」:该指标为无人值守全自动口径的底线值;实际使用是「机器人出初稿 + 人工分钟级复核」的 human-in-the-loop 流程,误报在复核环节可快速排除,对产品形态的实际影响有限。
基于历史日报场景脱敏改写的用例 + 人工标注的"该报哪些异常、正确的根因"。含 A 类(该检出异常)与 B 类(正常日不该误报)。
数值忠实率:模型复述的每个数是否与源数据一致(测数值幻觉);异常召回/精确:检出 vs 真值;格式合格率。跨模型可比。
按 rubric 给归因质量 1–5 分,并单独检测是否编造不存在的机制(机制编造率)。裁判固定为 DeepSeek 以保证跨模型公平。
每次改 prompt / 换模型跑一遍,召回 / 忠实退步 >2pt 或 judge 退步 >0.2 即报警;逐轮记 token 与真实 API 花费,成本可对账。
下表为其中一轮(DeepSeek 带方法论)的逐用例明细,示意黄金集的真实构成;换模型/配置即产出上面排行榜里的其余各轮。
| 用例 | 标签 | 场景 | 忠实 | 召回 | 精确 | judge | 编造 |
|---|---|---|---|---|---|---|---|
| case_001 | A类/归因/指标口径切换 | 示例客户A(中医自建站)转化目标从扫码切换为加企业微信,导致CTCVR、CPA表观骤变 | 100% | 0% | — | 4 | — |
| case_002 | A类/归因/落地页故障 | 示例客户B(兴趣教育)效率CPM较前一日大幅下跌,误判为效率崩盘,实为该产品落地页发版故障 | 100% | 100% | 100% | 4 | — |
| case_003 | A类/归因/地域调拨/客户级口径/客户甲 | 客户甲城市定向调拨复盘:若只拿两个调整后日期互比,会误判调拨未生效 | 100% | 0% | 0% | 5 | — |
| case_004 | A类/归因/超成本反推/兜底CPM | 示例客户D(兴趣教育)超成本长期在35-40%区间波动,需反推是否由兜底CPM机制主导 | 67% | 100% | 100% | 4 | — |
| case_005 | A类/归因/客户级口径 | 客户甲(兴趣教育)6/15-17三天后转下降,业务反馈到客率降约10%;千次到客率0.406→0.374 | 79% | 50% | 50% | 4 | — |
| case_006 | A类/口径 | 业务方/日报把兴趣教育四大客户到客率聚合成'行业到客率0.577'对外汇报,该数字能否代表兴趣教育行业真 | 100% | 0% | — | 1 | 是 |
| case_007 | A类/竞价 | 兴趣教育算法模型流量到客率比保量低19.5%(剔除炸群后仍差19.9%),业务方怀疑是算法bug或炸群/ | 100% | 0% | — | 2 | — |
| case_008 | A类/覆盖率 | analysis.md结论'外部首层正价课率0.31% vs 非外部首层0.83%'被当作兴趣教育行业规 | 100% | 0% | — | 1 | 是 |
| case_009 | A类/成熟窗口 | 2026-06-03起兴趣教育正价课大盘出现断崖(6/3=1→6/4=2→6/5-6/9=0),若用T- | 100% | — | — | 4 | — |
| case_010 | A类/数据管道 | 排查2026年5月billing实际扣费与日报业务收入总差异时,发现数仓主表 | 100% | 0% | — | 1 | — |
| case_011 | C类/维度混淆 | 客户甲(兴趣教育)6/15-17期间东三省曝光占比合计18.79%→13.09%(−5.71pp),四川 | 100% | 50% | 33% | 3 | — |
| case_012 | C类/代理变量 | 客户甲(兴趣教育)6/15-17期间WiFi流量(占比约85%)内部千次到客率从0.437跌至0.347 | 100% | 50% | 50% | 1 | 是 |
| case_013 | C类/相关性陷阱/归因主导 | 兴趣教育分日大盘'首层占比 vs 到客率'Pearson相关+0.601(看似首层越高到客越好),但客户 | 100% | — | — | 1 | 是 |
| case_014 | C类/口径边界/归因主导 | 用兴趣教育到客/正价课数据反推'首层流量整体质量'结论,被质疑方法论是否成立 | 100% | — | — | 1 | 是 |
| case_015 | C类/技术陷阱 | 客户甲变更日志(Grafana REST API导出)经pandas默认解析后,全部记录的解析时间都落在 | 80% | 0% | 0% | 2 | — |
| case_016 | B类/正常日 | 例行日报巡检:广告大盘2026-04-07近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 100% | — | — | 5 | — |
| case_017 | B类/正常日 | 例行日报巡检:广告大盘2026-04-14近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 100% | — | — | 5 | — |
| case_018 | B类/正常日 | 例行日报巡检:广告大盘2026-05-03近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 100% | — | — | 4 | — |
| case_019 | B类/正常日 | 例行日报巡检:广告大盘2026-05-07近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 100% | — | — | 4 | — |
| case_020 | B类/正常日 | 例行日报巡检:广告大盘2026-05-14近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 50% | — | — | 3 | — |
| case_021 | B类/正常日 | 例行日报巡检:广告大盘2026-05-19近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 100% | — | — | 5 | — |
| case_022 | B类/正常日 | 例行日报巡检:广告大盘2026-06-12近7天分日核心指标,判断当日是否存在需要上报的重大异常 | 0% | — | — | 3 | — |
A 类为"该检出异常"用例(看召回/精确);忠实率 100% = 模型没编数(数值由规则引擎算好喂入的设计使然)。