技术博客
LLM 大语言模型

【三分钟看懂 AskChem】把 14.7 万篇论文拆成 240 万条“证据”:AI 科研检索为什么要从找论文变成找 Claim?

yiwan-cat2026-08-05 19:05
【三分钟看懂 AskChem】把 14.7 万篇论文拆成 240 万条“证据”:AI 科研检索为什么要从找论文变成找 Claim?

【三分钟看懂 AskChem】把 14.7 万篇化学论文拆成 240 万条“证据”:AI 科研检索为什么要从找论文变成找 Claim?

论文:AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
作者:Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho
arXiv:2607.28618
项目:AskChemGitHub
本文数字与实验结论以 arXiv v1(2026-07-30) 为准;AskChem 是在线系统,后续页面数据与模型版本可能继续更新。

如果你用过 Google Scholar、Semantic Scholar,甚至各种 AI 论文检索工具,大概都遇到过同一个问题:

我明明问的是一个具体科学问题,你为什么又扔给我 20 篇论文?

比如化学家想知道:

“哪些电催化剂被用于把 CO₂ 还原成 CO?它们的法拉第效率是多少?”

真正想要的不是论文列表,而是散落在不同论文中的一条条事实:谁用了什么催化剂、在什么条件下、测出了什么值,以及这个值到底来自哪篇论文。

AskChem 这篇工作最有意思的地方,就在于它没有把重点放在“再训练一个更会回答问题的大模型”上,而是直接改了科研检索最底层的单位:

不再以 paper 为检索的最小单位,而是以带来源证据的 claim 为最小单位。

目前论文报告的系统规模是:147K 篇论文、2.4M 条 grounded claims、307K 个 taxonomy nodes、171,342 条 evidence edges,覆盖 1925–2026 年的化学文献。

这其实比“又一个 AI 搜索框”更值得关注。


01. 先看成品:AskChem 搜出来的不是“论文”,而是一条可以追责的结论

图1:AskChem 实际界面

AskChem 中的一条 claim,可以粗暴理解为一张“科学事实卡片”。

例如论文附录给出了一条真实记录:某种 Ni SA-N2-C 单原子镍催化剂用于 CO₂ 电还原生成 CO,报告 98% CO Faradaic efficiency1622 h⁻¹ turnover frequency

但 AskChem 不会只存一句模型总结。它还会把下面这些东西绑在同一个 claim 上:

  • claim_type:这是什么类型的结论;

  • source_doi:它来自哪篇论文;

  • reactants / products:反应物和产物;

  • outcomes:关键实验结果;

  • verbatim_quote:论文中的原文证据;

  • view_paths:它在不同知识分类体系中的位置;

  • confidence:抽取置信度。

所以它和“让 LLM 读完论文以后总结一句”有本质区别。

普通 RAG 往往在问:哪一段文字和问题最相似?
AskChem 进一步在问:哪一条可追溯的科学主张能回答这个问题?

这就是整篇论文最重要的一层变化。


02. 为什么从 Paper 变成 Claim,会让科研检索完全不一样?

想象一下传统论文搜索:

  1. 输入“CO₂ reduction catalyst”;

  2. 返回几十篇 paper;

  3. 人自己打开 PDF;

  4. 找实验条件、找性能数字;

  5. 对照引用;

  6. 再把多篇论文拼成一个结论。

问题是,论文是知识的容器,却不一定是回答问题最合适的粒度。

AskChem 的思路更像把一整座“论文仓库”预先拆成数百万个带身份证的小知识块:

Claim = 原子化科学主张 + 类型 + 结构化字段 + 来源 DOI + 原文证据/证据定位。

查询时,不需要先把整篇论文召回,再临时从里面“挖答案”;系统可以直接召回已经被结构化的具体发现。

作者甚至用了一个很形象的类比:Segment Anything 把图像分割成可复用区域,而 AskChem 想做的是把论文“分割”为可以单独检索、连接、验证的 claims。

当然,这个类比不是说二者算法相同,而是说它们在改变最小操作单元这件事上很相似。


03. 240 万条 Claim 是怎么来的?

图2:AskChem 总体架构

AskChem 的数据源包括 arXiv、ChemRxiv、期刊以及 Semantic Scholar 等文献来源。论文 v1 中用了两档抽取管线:

第一档:摘要级,高吞吐量

对大量论文标题和摘要进行批量抽取,论文附录记录的抽取模型为 GPT-5-mini

优点是便宜、快、覆盖广;缺点也很明显——摘要不可能包含所有假设、限制、反常结果和实验细节。

第二档:全文级,更深的 Claim Extraction

对可以获得全文 PDF 的论文,用 Gemini 3.1 Pro 进行 native-PDF 深度抽取。

这条管线能捕获很多摘要里没有的 claim,例如 limitation、hypothesis、surprising finding 等。

每次抽取都输出结构化 JSON,并经过 schema 验证,包括必需的 provenance 字段、数值范围以及化学相关字段。

这里要注意论文非常克制的一句话:

这些检查建立的是 traceability(可追溯性),不是对 claim 语义完全正确的证明。

也就是说,“我知道它从哪里来”不等于“模型一定理解对了”。

图3:数据规模、Claim 类型和抽取深度

从论文快照看:

  • 2.4M grounded claims;

  • 147K source papers;

  • 1925–2026 年;

  • 99.9% 的来源 DOI 经 CrossRef 验证;

  • 约 66% 的 claims 来自全文级抽取,34% 来自摘要级抽取;

  • 论文层面则约 30% 做了全文抽取、70% 只有摘要级抽取。

这两个“66% / 30%”并不矛盾:做过全文抽取的论文虽然数量较少,但一篇全文能产出远多于摘要的 claims。


04. 只有 Claim Store 还不够:AskChem 又在上面叠了三种“知识结构”

这是我认为论文第二个真正值得学的地方。

AskChem 没有把 240 万条 claim 简单塞进向量数据库就结束,而是让同一批 claims 同时进入三种互补结构。

4.1 Stabilized Faceted Taxonomy:回答“它是关于什么的?”

一条 CO₂ reduction 的 claim,可以同时从不同视角看:

  • Reaction:它属于什么反应?

  • Substance:涉及什么物质?

  • Application:应用是什么?

  • Technique:用了什么技术?

  • Mechanism:机制是什么?

  • Data:包含什么测量?

  • Claim type:这是什么性质的科学主张?

  • Time:它处在哪个时间阶段?

  • Author:谁做的?

  • Network:它和别的 claim 有什么关系?

图4:同一个“CO₂ reduction”主题的 10 个视角

关键点是:这不是 10 套彼此独立的数据,而是同一条 claim 的 10 个观察窗口。

论文中给出的典型路径像这样:

coupling / cross_coupling / suzuki

系统先从语料中诱导类别,再通过顶层 canonical routing、同义词归一化和近重复类别的 fuzzy clustering,把类别稳定为持久的 L1/L2/L3 路径。

这一步解决的是“知识怎么找、怎么浏览”的问题。

4.2 Evidence Graph:回答“这些发现之间是什么关系?”

科研真正麻烦的地方从来不只是“有没有这篇论文”,而是:

A 支持 B 吗?
C 是在 B 的基础上扩展的吗?
有没有另一篇论文直接反驳了这个结论?

因此 AskChem 又把 claim 之间连成有类型、有方向的边,关系包括:

  • supports

  • contradicts

  • extends

  • derives_from

  • cites_as_evidence

论文报告当前 evidence graph 有 171,342 条 typed edges

作者抽取 148 条边进行领域专家人工审核,其中 2 条无法判断;剩余 146 条中有 143 条关系类型判断正确,对应 97.9% edge-type precision

注意,这个数字证明的是抽样边的“关系类型准确率”,不能理解成整个 AskChem 的知识都达到 97.9% 正确。

4.3 Living Taxonomy:回答“这项工作受什么科学原理支配?”

前面的 Faceted Taxonomy 是为检索服务的;Living Taxonomy 更像一张“科学思想地图”。

它试图把论文放到 principle、theory、model、mechanism、phenomenon 等更高层科学概念下面。

图5:Living Taxonomy

论文中的 Living Taxonomy 共有 4,931 个节点,覆盖约 1.1M claims361K paper placements

而且它允许“拒绝硬塞”:如果一篇论文找不到合适的父节点,系统可以 abstain,并提出一个新的 branch。

这个设计很重要,因为真实科研知识不是一棵提前画死的树。

但作者同样没有把它包装成“完整化学本体”:论文明确称其为 exploratory,尚未完成系统性的专家 placement 验证。


05. 真正搜索时,AskChem 并没有只靠向量相似度

AskChem 的 /search 是一个 hybrid search。

它会综合至少四类召回信号:

  1. FTS5 的 claim-text 全文检索;

  2. paper-level recall;

  3. taxonomy-node recall;

  4. dense-vector recall。

然后用 **Reciprocal Rank Fusion(RRF)**合并排序结果。

这意味着 taxonomy 不是“做出来好看的可视化”,而是真正在检索路径里参与召回。

查询得到具体 claims 后,用户又可以沿着 taxonomy 看同类知识、沿 evidence graph 找支持/冲突证据,或者进入 Living Taxonomy 看它在更大科学框架中的位置。

于是一次搜索从一条“结果列表”,变成了一个可以继续探索的证据空间。


06. 为什么我觉得 MCP 反而是这篇论文很容易被低估的一部分?

如果 AskChem 只做一个网页,它依然是一款不错的科研搜索工具。

但论文把同样的 claim object 同时开放给:

  • Web UI;

  • REST API;

  • SDK;

  • MCP Server。

这意味着 AI Agent 不需要“打开搜索网页 → 阅读结果页 → 猜哪句话可信”,而是可以直接调用:

search(question)
  ↓
claim_id
  ↓
get_claim(claim_id)
  ↓
source DOI + verbatim evidence + taxonomy paths
  ↓
neighborhood(claim_id)
  ↓
supports / contradicts / extends ...

对 Agent 来说,这种接口比“再给它一个网页搜索工具”更关键。

因为 Agent 获取的不再是松散网页,而是已经带身份、来源和关系的可计算证据对象

我认为 AskChem 真正想做的并不是“化学版 Perplexity”,而更接近一种 AI scientist 可以直接调用的 literature infrastructure


07. 实验最关键的结果:不是答案更长,而是引用终于能被核验

作者构建了 AskChem-Bench v1.1,总共 30 个跨论文问题,分成三类,每类 10 个:

  • CA:condition aggregation,跨论文汇总条件;

  • TC:temporal tracking,追踪一个科学问题如何随时间演化;

  • CS:contradiction surfacing,寻找互相冲突的证据。

然后让 GPT-5.5 reader 在五种设置下回答同样的 30 个问题:

Metric

LLM only

+AskChem

+Paperclip

Edison Scientific

NotebookLM

DOI existence (%)

88.3

100

100

99.1

93.7

Citation density (/ans.)

9.6

18.1

7.5

10.7

7.9

Grounded specificity

8.1

5.9

0.5

29.2

0.1

Recent high-impact (%)

0.6

18.5

6.1

11.3

12.1

Paper relevance (0–3)

1.66

2.15

1.72

2.07

1.84

On-topic ≥ 2 (%)

65.8

86.6

57.8

89.7

78.9

AskChem 最漂亮的结果其实很直接:

GPT-5.5 单独回答时,引用 DOI 的可解析率是 88.3%;接入 AskChem 后达到 100%。

而且平均每个答案有 18.1 个经过验证的不同 DOI,是五种设置里最高的 citation density。

一个更直观的例子

图6:同一个问题下 GPT-5.5 单独回答与 +AskChem 的对比

在论文展示的 CO₂ reduction 示例里:

  • GPT-5.5 单独作答:14 个 DOI 中 6 个无法在 CrossRef 解析

  • GPT-5.5 + AskChem:22 个 DOI 全部可解析,示例中给出的数值来自检索到的 source abstracts。

这其实把 LLM 科研问答里一个很危险的问题暴露得非常清楚:

大模型最可怕的不一定是不知道,而是“像真的一样给你编一篇论文”。

AskChem 的解决路线不是指望模型突然变诚实,而是尽量让回答只能从带 provenance 的 claims 出发。


08. 但千万别把“100% DOI existence”看成“100% 科学正确”

这一点我想单独拿出来讲,因为它决定了我们怎么评价这篇工作。

论文的 100% 指的是:在 30 个 benchmark 问题中,+AskChem 生成答案引用到的 DOI 都能通过 CrossRef 解析。

它没有证明下面这些事情:

  • 每条 LLM 抽取出来的 claim 都语义正确;

  • 每个实验数字都被模型解释正确;

  • taxonomy placement 全部正确;

  • evidence graph 的所有边都正确;

  • 30 个问题足以代表真实化学科研的全部场景。

作者甚至主动把这些局限写得很清楚:

  1. 当前 corpus 只覆盖化学文献的一部分;

  2. 摘要级抽取明显浅于全文级抽取;

  3. LLM 生成的 claims、relations、taxonomy placements 都可能错;

  4. AskChem-Bench 只有 30 个问题,更偏 groundedness,而不是完整 factual accuracy 或 user utility;

  5. string-based taxonomy normalization 可能错误合并类别,也可能留下近重复类别;

  6. taxonomy-based recall 到底独立贡献了多少检索增益,目前没有被单独消融;

  7. Living Taxonomy 还没有完成系统性的专家 placement validation。

甚至从表 1 也能看到:AskChem 并不是所有指标都第一。

比如 Edison Scientific 的 Grounded specificity = 29.2,显著高于 AskChem 的 5.9;On-topic ≥2 也达到 89.7%,略高于 AskChem 的 86.6%。

所以这篇论文最强的卖点并不是“AskChem 已经打败所有科研助手”,而是:

它证明了把 provenance-carrying claim 做成可复用基础设施,是一条很有价值的路线。


09. 这篇论文真正值得学的,不只是“化学搜索”

读到这里,你会发现 AskChem 的核心思想其实并不只属于 chemistry。

很多专业知识系统都有同一个结构性问题:

文档很长,但用户真正需要的是“可以核验、可以连接、可以继续计算”的小粒度事实。

医学里可能是“某治疗在什么人群、什么剂量下得到什么结果”;材料学里可能是“什么制备条件得到什么性能”;机器人论文里可能是“什么模型在什么 benchmark、什么设置下取得什么成功率”。

如果只是把 PDF 切成 500-token chunks 扔进向量库,这些关系很容易丢失。

AskChem 给出的另一种思路是:

Document → Claim → Provenance → Taxonomy → Evidence Graph → Agent Tool

也就是说,未来科研 Agent 可能真正缺的不是更大的上下文窗口,而是一层更适合机器使用、同时又允许人类追溯的结构化证据基础设施

这一点,我认为比 2.4M 这个数字本身更重要。


10. 三分钟总结

如果只记住 AskChem 的 5 句话,可以记这五句:

  1. 它把科研检索的最小单位从 paper 改成了 claim。

  2. 每条 claim 都尽量携带 DOI + 原文 quote / evidence locator,让结果可以追溯。

  3. 240 万条 claims 不是平铺在向量库里,而是同时进入 faceted taxonomy、evidence graph 和 exploratory Living Taxonomy。

  4. 同一套 claim object 同时服务人类和 AI Agent,并通过 REST / SDK / MCP 暴露。

  5. 在 30 个 AskChem-Bench 问题上,+AskChem 将 GPT-5.5 引用 DOI 的可解析率从 88.3% 提升到 100%,但这不等于科学事实 100% 正确。

所以如果一定要用一句话概括这篇论文,我会写:

AskChem 不是在教 AI “更像科学家一样说话”,而是在给 AI 铺一层“每句话都能找到出处”的科研知识基础设施。

这可能才是 AI for Science 下一阶段真正重要的工程之一。


参考链接

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发