科研营销 · 行业大模型平台
科研线索 AI 商机平台
科研线索 AI 商机平台:从文献与方法段抽取课题组、设备与试剂信号,语义检索与 AI 商机挖掘,帮助科研耗材销售把「读论文」变成可跟进的线索列表。
科研耗材、试剂、仪器企业的销售,长期困在「线索从哪来」:真正有价值的信号藏在论文的方法段、试剂表与设备描述里,而不是工商名录或展会名片。销售要判断「这个 PI 是否在用 LC-MS、是否在做细胞培养」,传统做法是搜关键词、读摘要、托校友打听——慢、漏、极度依赖个人经验。 当企业试图自建数据库,很快会被文献体量淹没:PMC 等来源每年新增海量 XML,课题组去重、机构归一、耗材与设备实体抽取都是硬骨头。没有语义层,搜「质谱」会召回大量无关论文;没有 AI 挖掘层,线索无法批量评分、无法分配跟进。 国科智飞构建 RLDP 科研线索平台:后端 Celery 集群持续 ETL 文献,前端提供宏观数据看板、科研线索库(语义/关键词双检索)、线索详情(方法、试剂、设备、软件、研究领域云)与 AI 商机工作台(自然语言发现、批量分析、P0/P1 自动挖掘任务)。销售团队第一次可以在分钟级完成过去数天的文献调研。
业务挑战
- 全球文献与非结构化摘要体量巨大,课题组、机构、耗材信息分散难聚合
- 关键词检索无法理解研究意图,销售难以精准触达「正在做某实验方法」的客户
- 线索生产依赖人工读论文,无法形成可分配、可复盘、可量化的销售管道
- 缺乏对 AI 挖掘任务的成本、配额与效果监控,规模化运营不可控
我们的做法
- 搭建文献 ETL 管道与 Celery 任务监控,持续解析 PMC 等来源并维护主数据
- 抽取 PI、机构、方法、试剂、设备、软件等多维标签,支持导出与 API 对接
- 上线科研线索库:语义 + 关键词检索、快捷筛选、线索卡片与详情下钻
- 交付 AI 商机工作台:自然语言发现、勾选批量分析、自动/手动挖掘任务与配额策略
落地成果
- 173 万课题组线索可检索、可导出,销售从「找论文」升级为「找商机」
- 语义检索可在秒级返回千级高相关课题组,显著缩短目标客户筛选时间
- AI 挖掘任务分层(P0/P1)+ 日配额 5000 组,线索生产规模化且可监控
- 宏观看板呈现学科分布、产出趋势与 Token 成本,管理层可量化投入产出
项目深读
周一早上,一家科研耗材企业的销售打开电脑,准备安排这一周的拜访。他手上有什么?上个月展会换来的名片、微信群里转发的几篇论文,以及一些「听说某个组最近在扩细胞房」的模糊印象。要确认一位 PI 的实验室是不是真的在做细胞培养、是不是在用 LC-MS,他需要搜关键词、读摘要、托校友打听——一次完整的文献调研,往往以天为单位。
问题不在于销售不勤奋,而在于真正有用的信号不在论文的标题和摘要里。它在方法段、试剂表、仪器描述里,藏在「用了什么柱子、什么培养基、什么型号的质谱仪」这些句子中。这些句子决定了「这个课题组现在可能买什么」,而它们恰好是关键词搜索最不擅长处理的部分。
线索的瓶颈,从来不在「有没有数据」
把问题往下拆两层,会看到不一样的约束。
第一层:关键词检索不理解研究意图。输入「质谱」,召回的可能是物理系的方法学研究,也可能是医院检验科的临床报告——字面命中,意图不相关。销售要的不是「提到质谱的论文」,而是「正在用质谱做某类实验、且有采购可能的课题组」。
第二层:即使企业决心自建文献库,也会很快被工程细节卡住。PMC 等来源每年新增海量 XML;同一个课题组在不同论文里的署名写法并不一致;机构名称需要归一;耗材、试剂、设备要从行文中抽成结构化实体。没有这一层,数据库只是一堆更贵的 PDF。
第三层:线索不是「搜」出来的,是「生产」出来的。谁先看、谁跟进、哪些线索值得批量扫描、AI 调用花了多少成本——没有配额、分层和监控,AI 挖掘就只是一个新鲜的玩具,撑不起一条销售管道。
三个关键决定
先建主数据,再谈检索。 我们没有从「做一个更好用的搜索框」开始,而是先把 PI、机构、方法、试剂、设备、软件抽成多维标签,维护成可复用的主数据。理由很朴素:没有实体归一,语义检索只是让脏数据跑得更快。代价是前期看起来「不见成果」,但之后每一条线索、每一次导出、每一次 API 对接都吃这份红利。
语义与关键词双检索,而不是只押一边。 销售的工作有两副面孔:有时要精确,比如「LC-MS 质谱分析」;有时要探索,比如「最近有哪些组在做类器官」。前者需要关键词的确定性,后者需要语义的泛化能力。两个通道跑在同一份数据上,让两种问法都能被接住。
把 AI 挖掘做成有配额、有分层的任务系统。 自然语言发现是入口,真正的产能来自任务:勾选批量分析、P0/P1 分层、自动与手动任务并存,日配额 5000 组;同时把 Token 成本放上宏观看板。我们想交付的不是一个「随便聊」的助手,而是一台成本可预测、优先级可调度的线索生产机器。
落到工程上
平台后端由 Celery 集群持续做文献 ETL:解析 PMC 等来源、更新主数据、维护解析任务的状态与耗时。任务监控页能看到队列实时状态和单文件解析时间,出问题可以定位到具体环节。
数据侧,宏观概览呈现 280 万文件、173 万课题组,以及学科分布与产出趋势。前端是三个彼此衔接的界面:
- 科研线索库:语义与关键词双检索、快捷筛选。搜「LC-MS 质谱分析」,秒级返回 1593 条高相关线索;一张线索卡片聚合了 PI、方法、试剂、设备、软件与商机标签。
- 线索详情:553 个研究领域标签,加上耗材与试剂清单,让销售在下钻过程中完成原本要读论文才能完成的判断。
- AI 商机工作台:自然语言发现、批量分析与挖掘任务历史,例如 3500 组扫描的任务记录。
线索支持导出与 API 对接。这一点很关键:平台不要求业务方更换现有系统,只需要把「找商机」这一段接进去。
上线之后
最直接的变化是时间尺度。过去以天计的文献调研,现在可以在分钟级完成;173 万课题组线索可检索、可导出,销售的动作从「找论文」变成「找商机」。
更微妙的变化发生在团队内部。以前,判断哪个组「可能有需求」是资深销售的个人手感,很难传承;现在,它至少沉淀成一份共同的线索池和标签体系。新人不必从零建立直觉,可以沿着老同事的筛选路径先跑一遍。管理层的视角也变了:学科分布、产出趋势、Token 成本在同一块看板上,投入产出第一次可以被讨论,而不是被感觉。
给同行的三点参考
第一,先做数据资产化。实体归一和标签体系是慢功夫,但它决定了后面所有 AI 能力的天花板。第二,把「检索」和「生产」分开设计:检索服务个人的即时问题,任务系统服务团队的规模化产出,两者混在一起会两头不讨好。第三,从第一天起就把成本、配额和监控当作产品的一部分——AI 能力只有在可预测、可运营的前提下,才会被业务真正依赖。
核心能力
- 文献 ETL 与知识抽取
- 语义检索
- 行业大模型
- AI 商机挖掘