← 返回作品集

Eval 报告 · 数分机器人「归因质量」评测

被测:广告数分机器人(规则引擎 + LLM 归因)· 22 例黄金集 · 3 家国产旗舰 × 带 / 不带方法论 = 6 轮 · 裁判恒为 DeepSeek 系(跨家打分)
真实流程跑分 · 客户名/表名/数值已脱敏扰动
为「数分机器人」建的一套自动化评测:22 例基于历史日报场景脱敏改写、带标注答案的用例为黄金集,用代码型指标(数值是否忠实、异常是否检出)+ LLM-as-judge(归因质量、是否编造机制)量化质量,并作 prompt 改动的回归门禁。这次把三家国产旗舰各跑两轮:带方法论 skill裸模型,看"同一套方法论换到不同模型上值多少分"。核心目的:把"AI 归因到底靠不靠谱"从感觉变成可测、可对比、可对账的数。
6 轮
3 模型 × 2 配置
同一黄金集
4.50/5
Kimi K3 归因质量
(冠军 · 别家裁判打分)
4.5%
Kimi K3 机制编造率
(全场最低)
¥0.45
每次归因成本
(Kimi K3 实测)

六轮排行榜 · 三家旗舰 × 带/不带方法论

被测模型 × 配置 归因质量
judge 1–5
方法论增益
Δjudge
机制编造率
越低越好
异常定位
精确率
正常日
假阳性
DeepSeek V4 Flash +方法论3.05+0.5522.7%47.6%1/10
裸模型2.5031.8%22.2%3/10
GLM-5.2 +方法论3.82+0.6813.6%39.5%2/10
裸模型3.1422.7%40.3%4/10
Kimi K3 +方法论4.50+1.09 ▲4.5%47.7%3/10
裸模型3.4118.2%40.2%3/10

口径:裁判恒为 DeepSeek 系(温度 0),对 Kimi K3 / GLM 属跨家打分——K3 拿冠军是"别人家模型给它打的分",比自评更硬。DeepSeek / GLM 走免费量化通道,K3 走官方付费 API。n=22,单轮有波动,看趋势不看单点。
关于「异常定位精确率」:该指标为无人值守全自动口径的底线值;实际使用是「机器人出初稿 + 人工分钟级复核」的 human-in-the-loop 流程,误报在复核环节可快速排除,对产品形态的实际影响有限。

三个发现

① 模型越强,分越高。 Kimi K3 > GLM-5.2 > DeepSeek,且 K3 的分是别家模型(DeepSeek)打的,不是自己给自己打。
② 模型越强,加方法论涨得越多。 同一套方法论 skill,三家 judge 分别 +1.09 / +0.68 / +0.55——强模型更"吃"好方法论。
③ 加了方法论,三家编造机制的比例都降了。 意思是:模型越强,配一套好方法论越划算——把模型能力变成客户能用的东西,正是商业化要做的事

跑一次归因,实测多少钱

¥0.45
/ 次(Kimi K3,带方法论)
这个数能对账:评测里裁判走的是免费通道,充值花掉的钱全是被测模型自己的。官方账单 ¥7.72 ÷ 17 个跑通场景 = 一次 ¥0.45(该轮 in 78K / out 119K tokens)。
想更便宜:调低推理力度,或简单场景用免费模型、难的才上 K3——这就是"成本/质量"的产品权衡。

评测方法论

黄金集(22 例)

基于历史日报场景脱敏改写的用例 + 人工标注的"该报哪些异常、正确的根因"。含 A 类(该检出异常)与 B 类(正常日不该误报)。

代码型指标(确定性)

数值忠实率:模型复述的每个数是否与源数据一致(测数值幻觉);异常召回/精确:检出 vs 真值;格式合格率。跨模型可比。

LLM-as-judge(主观质量)

按 rubric 给归因质量 1–5 分,并单独检测是否编造不存在的机制(机制编造率)。裁判固定为 DeepSeek 以保证跨模型公平。

回归门禁 + 成本核算

每次改 prompt / 换模型跑一遍,召回 / 忠实退步 >2pt 或 judge 退步 >0.2 即报警;逐轮记 token 与真实 API 花费,成本可对账。

诚实注记(懂 eval 局限本身是成熟度):n=22、单轮跑,绝对分有波动,结论看趋势不看单点;② judge 有偏置风险,已固定为 DeepSeek 跨家裁判 + 金丝雀校准约束(对 K3/GLM 是"别家打分");③ 数值忠实率未进排行榜——该指标会惩罚"复述/派生更多数字"的强模型(Kimi/GLM 带方法论时忠实率反降),是已知度量局限、待改进,故排行榜聚焦 judge/编造/精确;④ 分数不完美,正说明这套 eval 真的在测出差异(满分的 eval 才可疑)。

逐案明细 · DeepSeek V4 Flash 带方法论(22 例 · 已脱敏)

下表为其中一轮(DeepSeek 带方法论)的逐用例明细,示意黄金集的真实构成;换模型/配置即产出上面排行榜里的其余各轮。

用例标签场景忠实召回精确judge编造
case_001A类/归因/指标口径切换示例客户A(中医自建站)转化目标从扫码切换为加企业微信,导致CTCVR、CPA表观骤变100%0%4
case_002A类/归因/落地页故障示例客户B(兴趣教育)效率CPM较前一日大幅下跌,误判为效率崩盘,实为该产品落地页发版故障100%100%100%4
case_003A类/归因/地域调拨/客户级口径/客户甲客户甲城市定向调拨复盘:若只拿两个调整后日期互比,会误判调拨未生效100%0%0%5
case_004A类/归因/超成本反推/兜底CPM示例客户D(兴趣教育)超成本长期在35-40%区间波动,需反推是否由兜底CPM机制主导67%100%100%4
case_005A类/归因/客户级口径客户甲(兴趣教育)6/15-17三天后转下降,业务反馈到客率降约10%;千次到客率0.406→0.37479%50%50%4
case_006A类/口径业务方/日报把兴趣教育四大客户到客率聚合成'行业到客率0.577'对外汇报,该数字能否代表兴趣教育行业真100%0%1
case_007A类/竞价兴趣教育算法模型流量到客率比保量低19.5%(剔除炸群后仍差19.9%),业务方怀疑是算法bug或炸群/100%0%2
case_008A类/覆盖率analysis.md结论'外部首层正价课率0.31% vs 非外部首层0.83%'被当作兴趣教育行业规100%0%1
case_009A类/成熟窗口2026-06-03起兴趣教育正价课大盘出现断崖(6/3=1→6/4=2→6/5-6/9=0),若用T-100%4
case_010A类/数据管道排查2026年5月billing实际扣费与日报业务收入总差异时,发现数仓主表100%0%1
case_011C类/维度混淆客户甲(兴趣教育)6/15-17期间东三省曝光占比合计18.79%→13.09%(−5.71pp),四川100%50%33%3
case_012C类/代理变量客户甲(兴趣教育)6/15-17期间WiFi流量(占比约85%)内部千次到客率从0.437跌至0.347100%50%50%1
case_013C类/相关性陷阱/归因主导兴趣教育分日大盘'首层占比 vs 到客率'Pearson相关+0.601(看似首层越高到客越好),但客户100%1
case_014C类/口径边界/归因主导用兴趣教育到客/正价课数据反推'首层流量整体质量'结论,被质疑方法论是否成立100%1
case_015C类/技术陷阱客户甲变更日志(Grafana REST API导出)经pandas默认解析后,全部记录的解析时间都落在80%0%0%2
case_016B类/正常日例行日报巡检:广告大盘2026-04-07近7天分日核心指标,判断当日是否存在需要上报的重大异常100%5
case_017B类/正常日例行日报巡检:广告大盘2026-04-14近7天分日核心指标,判断当日是否存在需要上报的重大异常100%5
case_018B类/正常日例行日报巡检:广告大盘2026-05-03近7天分日核心指标,判断当日是否存在需要上报的重大异常100%4
case_019B类/正常日例行日报巡检:广告大盘2026-05-07近7天分日核心指标,判断当日是否存在需要上报的重大异常100%4
case_020B类/正常日例行日报巡检:广告大盘2026-05-14近7天分日核心指标,判断当日是否存在需要上报的重大异常50%3
case_021B类/正常日例行日报巡检:广告大盘2026-05-19近7天分日核心指标,判断当日是否存在需要上报的重大异常100%5
case_022B类/正常日例行日报巡检:广告大盘2026-06-12近7天分日核心指标,判断当日是否存在需要上报的重大异常0%3

A 类为"该检出异常"用例(看召回/精确);忠实率 100% = 模型没编数(数值由规则引擎算好喂入的设计使然)。