数字只能由计算产生:我们如何让 agent 不编数
把通用大模型放到仪表盘前面,它会给你一个听起来很有道理的数字。我们的分工规则是:统计算数,agent 讲理,每个数字必须过证据接地校验。
「AI 分析」最常见的失败模式不是答错,而是答得很流畅。模型会给出一个结构完整、语气笃定、数字精确到小数点后一位的结论——而那个数字是它编的。对增长决策来说,这比不回答危险得多。
严格分工
- 统计检测器负责所有数字:扫描、聚合、显著性、阈值判断,全部是确定性计算,可复核,每个快照带指纹。
- 语言模型负责解释与编排:提出假设、组织证据链、写清楚为什么重要、决定下一步查什么。
- 两者之间是结构化产出:agent 引用的每个数字都挂着证据编号,指向证据表里的原始行。
证据接地校验
报告生成之后还有一道机器校验:把文本里出现的每个数字,拿去和它声称的证据编号比对。对不上的引用会被剔除,不是标灰,是删掉。这条规则的代价是报告偶尔会短一些,收益是你可以点开任何一个数字,看到它从哪来。
不可判定,就写不可判定
证据链走三路:内部数据、外部市场、两者综合。三路都排不出结论的时候,报告写「不可判定」并列出缺什么数据,而不是挑一个听起来最合理的解释。一个会说「我不知道」的系统,才值得在它说「我知道」的时候被相信。