科研营销 · 行业大模型平台

科研线索 AI 商机平台

科研线索 AI 商机平台:从文献与方法段抽取课题组、设备与试剂信号,语义检索与 AI 商机挖掘,帮助科研耗材销售把「读论文」变成可跟进的线索列表。

科研耗材、试剂、仪器企业的销售,长期困在「线索从哪来」:真正有价值的信号藏在论文的方法段、试剂表与设备描述里,而不是工商名录或展会名片。销售要判断「这个 PI 是否在用 LC-MS、是否在做细胞培养」,传统做法是搜关键词、读摘要、托校友打听——慢、漏、极度依赖个人经验。 当企业试图自建数据库,很快会被文献体量淹没:PMC 等来源每年新增海量 XML,课题组去重、机构归一、耗材与设备实体抽取都是硬骨头。没有语义层,搜「质谱」会召回大量无关论文;没有 AI 挖掘层,线索无法批量评分、无法分配跟进。 国科智飞构建 RLDP 科研线索平台:后端 Celery 集群持续 ETL 文献,前端提供宏观数据看板、科研线索库(语义/关键词双检索)、线索详情(方法、试剂、设备、软件、研究领域云)与 AI 商机工作台(自然语言发现、批量分析、P0/P1 自动挖掘任务)。销售团队第一次可以在分钟级完成过去数天的文献调研。

业务挑战

我们的做法

落地成果

项目深读

周一早上,一家科研耗材企业的销售打开电脑,准备安排这一周的拜访。他手上有什么?上个月展会换来的名片、微信群里转发的几篇论文,以及一些「听说某个组最近在扩细胞房」的模糊印象。要确认一位 PI 的实验室是不是真的在做细胞培养、是不是在用 LC-MS,他需要搜关键词、读摘要、托校友打听——一次完整的文献调研,往往以天为单位。

问题不在于销售不勤奋,而在于真正有用的信号不在论文的标题和摘要里。它在方法段、试剂表、仪器描述里,藏在「用了什么柱子、什么培养基、什么型号的质谱仪」这些句子中。这些句子决定了「这个课题组现在可能买什么」,而它们恰好是关键词搜索最不擅长处理的部分。

线索的瓶颈,从来不在「有没有数据」

把问题往下拆两层,会看到不一样的约束。

第一层:关键词检索不理解研究意图。输入「质谱」,召回的可能是物理系的方法学研究,也可能是医院检验科的临床报告——字面命中,意图不相关。销售要的不是「提到质谱的论文」,而是「正在用质谱做某类实验、且有采购可能的课题组」。

第二层:即使企业决心自建文献库,也会很快被工程细节卡住。PMC 等来源每年新增海量 XML;同一个课题组在不同论文里的署名写法并不一致;机构名称需要归一;耗材、试剂、设备要从行文中抽成结构化实体。没有这一层,数据库只是一堆更贵的 PDF。

第三层:线索不是「搜」出来的,是「生产」出来的。谁先看、谁跟进、哪些线索值得批量扫描、AI 调用花了多少成本——没有配额、分层和监控,AI 挖掘就只是一个新鲜的玩具,撑不起一条销售管道。

三个关键决定

先建主数据,再谈检索。 我们没有从「做一个更好用的搜索框」开始,而是先把 PI、机构、方法、试剂、设备、软件抽成多维标签,维护成可复用的主数据。理由很朴素:没有实体归一,语义检索只是让脏数据跑得更快。代价是前期看起来「不见成果」,但之后每一条线索、每一次导出、每一次 API 对接都吃这份红利。

语义与关键词双检索,而不是只押一边。 销售的工作有两副面孔:有时要精确,比如「LC-MS 质谱分析」;有时要探索,比如「最近有哪些组在做类器官」。前者需要关键词的确定性,后者需要语义的泛化能力。两个通道跑在同一份数据上,让两种问法都能被接住。

把 AI 挖掘做成有配额、有分层的任务系统。 自然语言发现是入口,真正的产能来自任务:勾选批量分析、P0/P1 分层、自动与手动任务并存,日配额 5000 组;同时把 Token 成本放上宏观看板。我们想交付的不是一个「随便聊」的助手,而是一台成本可预测、优先级可调度的线索生产机器。

落到工程上

平台后端由 Celery 集群持续做文献 ETL:解析 PMC 等来源、更新主数据、维护解析任务的状态与耗时。任务监控页能看到队列实时状态和单文件解析时间,出问题可以定位到具体环节。

数据侧,宏观概览呈现 280 万文件、173 万课题组,以及学科分布与产出趋势。前端是三个彼此衔接的界面:

线索支持导出与 API 对接。这一点很关键:平台不要求业务方更换现有系统,只需要把「找商机」这一段接进去。

上线之后

最直接的变化是时间尺度。过去以天计的文献调研,现在可以在分钟级完成;173 万课题组线索可检索、可导出,销售的动作从「找论文」变成「找商机」。

更微妙的变化发生在团队内部。以前,判断哪个组「可能有需求」是资深销售的个人手感,很难传承;现在,它至少沉淀成一份共同的线索池和标签体系。新人不必从零建立直觉,可以沿着老同事的筛选路径先跑一遍。管理层的视角也变了:学科分布、产出趋势、Token 成本在同一块看板上,投入产出第一次可以被讨论,而不是被感觉。

给同行的三点参考

第一,先做数据资产化。实体归一和标签体系是慢功夫,但它决定了后面所有 AI 能力的天花板。第二,把「检索」和「生产」分开设计:检索服务个人的即时问题,任务系统服务团队的规模化产出,两者混在一起会两头不讨好。第三,从第一天起就把成本、配额和监控当作产品的一部分——AI 能力只有在可预测、可运营的前提下,才会被业务真正依赖。

核心能力