前沿洞见 · 行业观察 · · 国科智飞 Gavin

AI 创业的岔路口:黄砖路,还是奥兹国的其他地方?

大模型吃掉通用任务,创业公司的机会在哪里?a16z 的答案是:别挤在黄砖路上,去奥兹国的其他地方。

大模型一代比一代强,AI 应用公司还有活路吗?

a16z 合伙人 Joe Schmidt 最近写了一篇《Avoiding Death on the Yellow Brick Road》,给了一个很形象的回答:不要问"应用层还有没有机会",要问你站在黄砖路上,还是奥兹国的其他地方。(原文:https://a16z.com/avoiding-death-on-the-yellow-brick-road)

黄砖路来自《绿野仙踪》,是那条最显眼、人人都看得见的大路。在这篇文章里,它指的是模型公司正在走的方向;而"奥兹国的其他地方",是模型公司看不上、也做不动的那些角落。这个比喻值得展开——因为它同时回答了两个问题:哪些 AI 应用会被碾过去,哪些会越活越值钱。

黄砖路:最容易走,也最危险

黄砖路是模型公司的主场:更强的通用模型、开箱即用的连接器、面向所有行业的水平工具。代码生成、写作、图像创作、通用搜索——这些任务步数少、标准清晰、市场巨大,天然属于平台。

一个创业公司如果只是"拿最强的模型,接一批标准工具,再套一层编排",看起来跑得飞快,实际上是在别人的主场竞争。模型公司有模型的定价权、分发能力和品牌,这条路只会越来越挤。

Joe Schmidt 的警告很直接:如果做的是同样的连接器、同样的模式,底下没有深度配置,也没有自己的分发能力,那大概率走在一条通往"哪里都不是"的路上——文章标题里的"死亡",指的就是这种不知不觉的平庸化。

奥兹国:复杂、垂直、必须对结果负责

奥兹国的其他地方,是通用模型搞不定的问题:行业里的隐性规则、多步骤的审核流程、必须可解释可审计的决策。

这些问题不够"性感",但足够深。深到什么程度?深到"下一个模型发布"带不走你的客户。因为客户买的不是模型输出,而是一套嵌进业务流程、能持续运转的工作系统。

文章里的对照很直观:一边是"帮我搜一下网盘里的文件",一步完成,结果错了重搜一次就好;另一边是律所三年的先例审查,几十步、跨多个工具,输出要过合伙人审核,甚至可能在法庭上被辩论。只有后者,才需要一支专注的团队花几年去构建深度软件。

两个来自一线的案例

a16z 在文章里放了两个深度访谈,一个做销售,一个做保险,恰好代表了两条不同的深扎路径。

销售案例:11x(CEO Prabhav Jain)。 他们从客户真正关心的结果出发——不是"帮你写邮件",而是"帮你产生更多合格的销售管道"。把活动拆成任务之后发现:真实工作流里大约一半任务是非代理式的,实验室在这些任务上并没有优势;剩下的一半代理式任务,也需要针对结果去调、去训练、去约束。他们还发现,真实的 GTM 数据是脏的:CRM 记录过时、子公司与母公司的域名混淆、冷邮件发给了现有客户的 CRO。模型不会自动跨过"数据脏"这道坎,这恰恰是应用公司的活。护栏也是他们的经验:即使在同一个产品内部,每个场景都需要自己的护栏,而且护栏必须按客户配置、持续审计。

保险案例:FurtherAI(CEO Aman Gour)。 他们的反共识假设是:智能不在模型里,在工作流里。保险行业大量隐性逻辑——哪些风险必须上报、哪些损失信号值得关注、两条规则冲突时哪条优先、什么情况下必须有人签字——散落在 SOP、经理的审核记录、核保理念里,其中很大一部分根本没有被写下来。他们的解法不是纯代理,也不是硬编码,而是"代理式工作流":工作流负责可重复、可审计、可控成本;代理负责处理不确定性;人留在循环里,处理需要担责的判断。

FurtherAI 有一句话点破了这类公司的护城河怎么长出来:第一天交付的工作流不是护城河,生产使用产生的反馈循环才是——每一次上报变成信号,每一次例外变成反馈,每一次人工修正暴露出手册的不完整。慢慢地,工作流不再是脚本,而变成了这家公司的运营记忆。

四道护城河

Joe Schmidt 总结了这类公司会积累的四样东西:

**数据和学习的飞轮。**行业里真正重要的知识,大多没写在公开网页上,而在老师傅的脑子里、在例外处理的记录里。这里其实有两种飞轮:一种是跨客户的——同一类问题在不同客户那里反复出现,应用公司能看到问题的"形状";另一种是单个客户内部的——每个决策背后的原因、没被写下来的例外。客户数据不能跨客户使用,但问题类型的模式识别可以。跑过一万次真实业务的公司,会把问题的形状内化——这种积累,靠一套新提示词复制不来。

**承接模型的变化。**每次新模型发布,重新做评估、重新校准、帮客户消化迁移成本。文章里特别提到几件实验室不会做的事:跨厂商路由(一家实验室不会用竞争对手的模型来评估子任务)、为极窄的环节专门做开源微调、在整个模型市场里为每个子任务挑最优解。实验室把下一个模型卖给你,让你自己迁移;应用公司帮客户把迁移成本吸收掉。谁做了这些琐事,谁就有存在价值。

**成本结构。**不是每个任务都值得用最贵的模型。最难的任务交前沿模型,大部分任务交中端模型,反复出现的窄场景交微调后的小模型。文章里有个精辟的对照:实验室定的是智能的"底价"——花多少钱能买到的最低智能;应用公司卖的是反过来的东西——为工作流实际需要的智能水平,找到最低的成本。省下来的成本,既是自己的毛利,也是客户的预算空间。

**治理。**权限、审计、边界、责任——这是最被低估的一道墙。不同行业有不同的监管框架(法律、医疗、金融各有各的规矩),不同岗位需要完全不同的护栏。文章里引用 CIO 的真实诉求:他们要的是敢在合同里白纸黑字写明"我为代理的合规负责"的合作伙伴。行业越受监管,客户越需要有人敢为结果负责。

四道护城河指向同一件事:专注。可以是一个垂直行业(保险、法律、会计),也可以是一个做深做透的功能(销售、客服、财务)。

三个问题,自测你在哪条路上

  1. 步数测试:完成这件事要几十步、跨多少工具?一步就能完成的事,平台顺手就做了。
  2. 系统测试:你交付的是客户离不开的系统,还是叠加在别人系统上的一层壳?关键提问是:如果实验室明天发布一个类似的竞争产品,客户还需要你吗?
  3. 损益测试:客户为"效果"付费,还是为"能力"付费?文章里说,实验室用 benchmark 评判,奥兹国的公司用客户的 P&L 评判。如果客户买的是通用能力,一张前沿模型的席位就够了;如果客户死死盯着业务结果,你才在奥兹国的地盘上。

我们怎么看

这套框架放在中国市场同样成立。过去两年,通用能力在以肉眼可见的速度商品化,真正拉开差距的,是有没有人把行业的隐性知识写进了工作流,有没有人愿意为结果承担责任。

文章最后的判断我们也认同:黄砖路上和路之外,都会出现巨大的赢家——模型公司拥有模型和分发能力,应用公司拥有工作系统、从工作中沉淀的数据,以及数据采集与治理层。而当垂直领域的工作流不断成熟,它们会汇聚成客户最终依赖的核心体验,成为把智能交付给客户的中间层。

对正在选 AI 伙伴的企业,我们的建议是少看功能清单,多问三个问题:它嵌进了我的流程,还是我迁就它的产品?它沉淀的是我的数据资产,还是它的标杆案例?出问题的时候,它敢不敢和我一起负责?

实验室不会替客户做这些琐事;模型在底层可以随时替换,工作系统不行。下一代企业软件,会在黄砖路之外被建出来。