前沿洞见 · 行业观察 · · 国科智飞 Gavin
数据贸易的护城河,不在 LLM,在脏活累活
数据贸易表面是搜索,本质是数据清洗、评分标准化、LLM 合成的管道。LLM 不是护城河,愿意做脏活累活的人才是。
最近看到一个「社媒搜索」工具,表面上是帮你搜几个平台的内容,拆开看,本质是一条由三个动作串起来的管道:数据清洗 → 评分标准化 → LLM 合成。
它让我重新想了一遍:做数据生意,护城河到底在哪?
为什么是现在
这波数据生意的热度,来自一个错位:合成能力在过剩,清洗能力在稀缺。
大模型把「把数据变成内容」的成本压到了人人可及,于是价值向上游移动——谁能拿到干净的、可比较的数据,谁就有话语权。但清洗和标准化是反规模效应的活:它不靠天才的算法,靠一次次对齐和一轮轮修正。越是被技术乐观情绪忽略的地方,越是空出来的位置。市面上大部分团队都在卷模型和提示词,愿意卷数据管道的人反而少。
三层管道,各自的难点
**第一层,数据清洗。**要接入多个平台的接口,每个平台的数据结构、口径、时效都不一样,必须先对齐,输出才可用。这话听起来轻巧,做起来是大量琐碎的人工适配:字段怎么映射、重复内容怎么去、水军和刷量怎么过滤、昨天能用的接口今天变了怎么办。接一个平台就是一次定制,而且不是一劳永逸——平台改接口不会通知你,管道要一直养着。
**第二层,评分标准化。**不同平台的「热度」「质量」没有可比性。点赞、转发、收藏、评论,在每个平台的含金量不同;十万粉丝的账号和一千粉丝的账号,声量也不在一个量纲上。只有建立一套统一的评分体系,跨平台的数据才谈得上比较——否则你交给用户的只是几堆拼不到一起的原料。这一步难,不是难在算法,是难在要替用户做出一堆价值判断:什么算好内容、什么算真实热度,然后把判断固化成一套可复用的规则。
**第三层,LLM 合成。**把清洗后的数据变成人愿意看、愿意付费的内容。这一层今天几乎人人都能做——模型每个月都在变强,提示词框架在圈子里公开流传,合成能力的半衰期越来越短。
这三层里,第一层和第二层没有技术奇观,只有耐心。也正因如此,它们最容易被低估。
壁垒是怎么长出来的
这套东西会自己加厚:渠道接得越多,评分越准;评分越准,用户越多;用户越多,反馈越多,评分又更准。
这个循环里真正的资产有两个:渠道关系和错误修正记录。哪些平台怎么接才稳、哪类内容在哪个平台是虚火、哪个字段历史上有坑——这些东西不在任何一个公开数据集里,只能靠一天天做出来。后来者想追,不是买一个更强的模型就行,而是要把所有的脏活重做一遍。数据质量的差距,用户第一天往往看不出来——因为他没有另一个更准的版本作对照;等到业务真正依赖它了,才发现换不掉。更现实的是,评分体系一旦被用户接受,历史数据就带上了同一套口径,换供应商意味着历史不可比,迁移成本比价差更贵。壁垒通常就是这样长出来的。
真正的壁垒不在技术
三层都有壁垒,但壁垒不在技术,而在:谁愿意做那个脏活累活——一家一家接平台,一个字段一个字段对齐,日复一日地维护。这活不性感,也很难靠热情外包。
LLM 在这条链里扮演的是合成层。它不是护城河,护城河是数据渠道和评分体系——前者决定你拿不拿得到数据,后者决定你拿到的数据有没有意义。
这里要回应两个常见的侥幸心理。第一个是「买现成数据集不就行了」:公开数据集覆盖的是通用维度,垂直场景要的口径往往不在里面;而且数据集是快照,生意的价值在持续的更新和维护。第二个是「平台自己会做」:平台做的是自家数据,跨平台的中立比较恰恰是第三方的位置——但这也是风险所在,渠道政策一变,上游就掐住了你,所以渠道关系本身就是需要长期经营的资产。
这类生意的组织形态
这类生意的组织形态,和「AI 创业」的想象很不一样。
它不靠一个明星工程师,靠一批能忍受重复的人:愿意为一个字段的口径和同事争论半天,愿意每天看一眼数据质量报告,愿意在平台接口变更时连夜修管道。招人时最该问的不是「你会什么模型」,而是「你能不能把一件枯燥的事做出稳定质量」。
管理上有一个反直觉的点:**不要只考核吞吐量。**如果 KPI 只奖励「接了多少平台、发了多少报告」,质量一定先垮,而质量垮了用户不会立刻走——他们会悄悄不再依赖你,等发现时已经晚了。数据生意的复利长在质量上,考核就要长在质量上。
起步阶段,一个人也能做:选场景、手工跑通、找付费验证。但过了验证期,最好尽早把「管道维护」设成专职角色,而不是让所有人兼职——管道是资产,资产需要看护人。
判断标准
数据的问题从来不是「有没有」,而是「能不能比对手更快、更便宜、更高质量地拿到并清洗好」。谁能把这三件事持续做住,谁就握着定价权。
定价权的来源,不是「我做得比你好」,而是「换掉我的成本比你想象中高」。当用户的历史数据、内部报表、决策习惯都长在你的口径上时,价格就不再只是价格的比较。
反过来说,只做合成层的团队最危险:模型一升级,昨天的合成能力就变成了人人都有的基础功能。上游没有渠道,下游没有评分,中间那一段随时会被抹平。
还有一个边界值得记住:这套逻辑成立的前提,是「跨源比较」本身对用户有价值。如果某个场景只需要单一平台的数据,或者监管把各平台的口径统一成了公共标准,又或者用户只要一个模糊的感觉、不在意数据是否可比,那么清洗和评分带来的溢价都会大幅缩水。护城河永远长在需求最苛刻的地方——用户越在意数据的可比和可信,前面两层的价值才越大。
垂直领域的机会地图
- 已有大量用户沉淀的社区(如 Reddit、Hacker News):天然的数据源。谁理解社区,谁就站在上游。
- **有独特数据源、但缺合成能力的:**最容易被「清洗 + 评分 + 合成」的模式降维打击。
- **已经有接口、但输出质量差的:**合成层的创业机会。
如果真要做这件事,行动顺序大致是:先选一个用户必须跨源比较的垂直场景;把两到三个数据源手工跑通,定义清楚统一口径;做出一个愿意让人付费的样例;验证有人回头用,再谈自动化和扩源。跳过手工验证直接铺渠道,通常是在给一个没人验证的需求修管道。
说回来
如果要做数据生意,先问自己一个问题:这门生意里,最脏最累的活是什么?你愿不愿意亲手做?
你愿不愿意做那个脏活,决定护城河有多深——而不是你用了多强的模型。