前沿洞见 · AI落地 · · 国科智飞 Gavin

AI 的确定不在模型里,在流程里

同一个问题问两遍答案不一样,改一个字的措辞输出天差地别。随机性是大模型的固有属性,不是 bug——确定不在模型里,在流程设计里。

第一次认真用大模型的人,大多经历过同一个瞬间:同一个问题问两遍,答案不一样;改一个字的措辞,输出天差地别;偶尔它还会一本正经地编出一段不存在的事实。

很多人的结论是:AI 不靠谱。

我们的判断相反:**这不是没调好的 bug,而是大语言模型的固有属性。**模型的本质是海量统计模式,不是因果链条——它在根据概率生成下一个词,而不是沿着一条固定逻辑推演。想让模型本身「每次都一样」,方向从一开始就错了。

那确定从哪里来?答案不在模型里,在你和模型之间的流程设计里。

四类不确定性,四种应对

把大家遇到的「AI 不听话」拆开,其实是四类问题:

一条一条看,每一类对应的其实不是「更聪明的提问」,而是一层工程手段。采样参数调低,是把随机空间压窄;输出格式固定,是给结果装上模具;工作流,是把一次赌博拆成多个可检验的步骤;检索增强,是把模型的嘴绑在资料上,而不是绑在记忆上。

这里有一个边界要讲清楚:**这些手段降低不确定性,但都不承诺消除它。**温度调到零,也可能因为推理批次差异偶有波动;检索增强能大幅减少幻觉,但检索到的资料本身错了,模型只会错得更自信。工程手段的作用,是让错误变得可见、可查、可控——而不是让错误消失。凡是承诺「彻底解决」的方案,都值得多问一句。

举个具体的例子:同样是让 AI 做客服回复,散着用,就是每次丢一句话让它「写个回复」,语气和口径全凭运气;放进流程,则变成固定几道关卡——先识别问题类型,再检索产品资料,再按模板生成,最后过人审和敏感词校验。前者靠的是模型这次表现好不好,后者靠的是流程设计得好不好。

再比如提取合同信息:与其叮嘱它「仔细看」,不如把要提取的字段定义清楚,要求它输出结构化结果,再用规则校验金额、日期和主体是否自洽。这时候准确率不来自模型的心情,来自你给它设的轨道。

有人会说:等模型再强一点,随机性不就没了吗?我们的判断是不会。生成能力越强,可选的表达空间越大;随机性是统计生成方式的代价,不是能力不足的表现。要等的不是更好的模型,而是更好的流程。

用约束代替随机,用流程代替信任

我们把上面的做法压成两句话:

用约束代替随机,用流程代替信任。

约束,指的是格式、结构、工具链——让模型在护栏内工作;流程,指的是可复现的步骤——每一步都有验证,而不是把结果寄托在「这次应该没问题」。

这和制造业从老师傅手感走向流水线是同一个道理。手感不是不好,而是不可复制。AI 也一样:单次惊艳不难,难的是每次都能交付。

但约束不是越多越好,它有自己的适用边界。**探索阶段要放开,交付阶段要收住。**让 AI 帮你想十个活动创意、找几个新角度,这时候的随机是资产,不是风险;一旦进入要交付给客户、要写进系统的环节,才轮到模板、校验和审核上场。把流程用在发散题上,等于用模具做雕塑——形状是稳了,东西也死了。

所以流程设计的第一步,其实是分类:这件事,究竟是需要惊喜,还是需要稳定?分错了,再精致的流程也是负担。

说回来

模型会一直有随机性。好的团队不是找到一个不随机的模型,而是设计一个即使模型随机、结果依然稳定的流程。

AI 时代的确定,不在模型里,在你和模型之间的流程设计里。