← 返回列表

论文综述:SciAtlas 面向自动化科研的大规模知识图谱

SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research

原文作者 Yunxiang Wei, Jiazheng Fan, Bin Wu, Busheng Zhang, Mengru Wang, Yuqi Zhu, Ningyu Zhang, Keyan Ding, Qiang Zhang, Huajun Chen 机构 Zhejiang University, University College London 论文发布 2026-05-20 综述日期 2026-05-31 HF 票数 🔺 57
knowledge-graphscientific-researchAI-agentretrievalNeo4j
📄 查看原文 →

一、论文是干什么的?

知识图谱是什么?把图书馆里每本书不只按类别摆放,还用绳子把互相有关系的书连接起来——谁引用了谁、谁研究同一概念……形成一张”知识网络”。基本单元是三元组:(实体A,关系,实体B),例如”论文甲→引用→论文乙”。

现有学术搜索工具的不足:

  • Google Scholar:关键词匹配,浅表且会漏掉使用不同术语的相关论文
  • Semantic Scholar:语义向量搜索,稍好但仍是”平面化”比较,无法理解”A引用了B,B又影响了C”这种深层逻辑关联

AI 科研助手的困境: 缺乏结构化知识地图作为锚点,AI 在探索复杂文献关系时容易产生”幻觉式引用”,而且每次搜索都需要 LLM 反复迭代,成本高昂。

SciAtlas 提供一张确定性的、结构化的”认知地图”,让 AI 代理在科研中有据可查。

二、核心方法与创新

图谱构建

原始数据来自 OpenAlex(开源学术数据库,4.8 亿论文),筛出 4300 万篇高质量英文论文,覆盖 26 个学科。

Qwen3-30B-A3B-Instruct(MoE 架构,激活仅 3B 参数)从每篇摘要提取 3–8 个核心关键词,形成 376 万关键词节点。再用 bge-large-en-v1.5 将标题和摘要编码为 1024 维语义向量,存入 Neo4j 图数据库。

图谱规模:

指标数量
论文节点4330 万篇
作者节点1.097 亿
关键词节点376 万
机构节点12 万
总关系数30 亿条
引用关系2.14 亿

三路径协同召回 + 图重排序

普通搜索是”找距离最近的点”,SciAtlas 则是”考虑道路连通性,找真正最容易到达的目的地”。

检索时三条路同时走:

  • 路径一:关键词匹配 — 从查询中提取关键词,在图谱关键词节点做精确和语义近似匹配(阈值 0.7)
  • 路径二:语义向量搜索 — 查询转为 1024 维向量,分别基于标题和摘要向量检索候选,用 bge-reranker-large 重排序,按标题得分和摘要得分以 0.4:0.6 的比例加权合并
  • 路径三:标题精确匹配 — 处理含具体论文标题或参考文献的查询

三路合并后,从种子节点出发做 2跳随机游走,沿引用边、关键词共现边探索”隐性关联论文”。最终排序综合三个因子:相关性(权重 0.35)+ 图拓扑支持度(权重 0.45)+ 引用影响力(权重 0.20)。

整个检索在 2 分钟内完成。

三、使用了哪些模型和计算资源?

组件模型
关键词提取Qwen3-30B-A3B-Instruct(MoE,激活 3B)
语义嵌入bge-large-en-v1.5(北京智源研究院)
重排序bge-reranker-large
图数据库Neo4j(支持 Cypher 查询 + 1024 维向量索引)

构建基础设施: 暂无相关信息(处理 4300 万篇论文、构建 30 亿关系的规模极大,具体服务器和 GPU 配置未公开)。

使用方式: 用户无需本地 GPU,通过 http://scinet.openkg.cn API 访问即可,pip 安装轻量客户端即可调用。

四、实验结果

需要特别说明:论文 v1 版本仅有定性分析和案例演示,没有与 Google Scholar、Semantic Scholar 等工具的系统性量化对比。 作者在”局限性”一节坦承,构建量化评测基准是首要的未来工作。

目前可量化的信息:检索速度在 2 分钟内完成,覆盖 4300 万论文、26 个学科。

五、潜在应用与已落地应用

已开放:

  • GitHub 开源仓库(zjunlp/SciAtlas),已有 112 颗星,Python SDK 可 pip 安装
  • 托管 API(scinet.openkg.cn),注册 Token 即可调用,无需本地部署
  • 已整合进浙大 SciGraph 开放知识图谱平台(scigraph.openkg.cn)

六大应用场景:

  1. 文献综述自动化 — 输入研究方向,自动检索最相关论文,生成综述报告
  2. 研究想法定位 — 检验某个想法是否已有先行研究,找出创新点
  3. 想法生成 — 以某篇论文为锚点,探索周边知识空间,触发跨领域创新
  4. 研究趋势预测 — 分析某方向的论文时间序列,总结演进轨迹
  5. 相关作者检索 — 找到在特定方向上最具影响力的研究者
  6. 学者背景画像 — 根据作者所有论文自动生成研究轨迹报告

六、网络上的讨论与评价

论文于 2026 年 5 月 20 日发布,GitHub 仓库已有 112 颗星和 7 个 Fork,表明社区已有初步关注,但尚未形成大规模讨论。已被整合进浙大 OpenKG 平台,说明有机构层面的持续投入。

团队背景: 来自浙江大学 ZJUNLP 实验室,负责人陈华钧教授和张宁豫副教授是知识图谱与 NLP 领域高产研究者,代表性工作包括 EasyEdit(ACL 2024 知识编辑框架)和 AutoKG(用 LLM 自动构建知识图谱)。

客观评估: 论文的方法论设计完整,工程落地扎实(Neo4j + Python SDK + 托管 API)。主要局限是 v1 版本缺乏量化基准——在拿出与现有工具的严格量化对比之前,实际效果仍需进一步验证。适合当前用于快速获取某研究方向的文献全貌,或为 AI 科研代理提供结构化知识基础。

七、思维导图

mindmap
  root((SciAtlas))
    知识图谱规模
      数据来源 OpenAlex 43.3M篇论文
      图谱规模
        157M个实体节点
        30亿条三元组关系
        9种实体类型 12种关系类型
      部署 Neo4j图数据库
      关键词提取 Qwen3-30B 每篇3至8个关键词
      语义嵌入 bge-large-en-v1.5 1024维
        覆盖标题 摘要 关键词
    三路径协同召回
      路径一 关键词匹配
        精确匹配得分 score_exact = LLM相关性分s_llm
        向量匹配得分 score_vec = s_llm乘相似度
        关键词阈值 θ_kw = 0.7
      路径二 语义检索
        bge-large-en-v1.5初始召回Top-60
        bge-reranker-large重排至Top-15
        得分 0.4乘标题分 + 0.6乘摘要分
      路径三 标题匹配
        得分 0.65乘序列相似度 + 0.35乘token重叠率
    图传播算法
      带重启的随机游走 Random Walk with Restart
      转移概率 P(v|u) = 边权重除以邻居权重总和
      迭代公式 r_v_t+1 = α乘s_v + 1-α乘邻居传播
      重启概率 α = 0.15
      收敛条件 L1变化小于1e-6 或最多50次迭代
    边权重配置
      HAS_KEYWORD边 ω = 1.20 乘 κ 乘 rel
        κ为关键词稀有度加权
      CITES引用边 ω = 1.00
      COAUTHOR合作边 ω = β 乘 max(1, log(1+n))
      COOCCUR共现边 ω = β 乘 max(1, log(1+n))
        对数频率平滑避免高频关系主导
    最终排名公式
      s_final = 0.35乘预检索分 + 0.45乘图传播分乘门控 + 0.20乘影响力分
      图支撑门控 g_p = max(0.25, 预检索分)
      防止低预检索分文章通过图传播虚假升排
    检索性能
      每次查询返回Top-20论文
      附带详细得分分解和路径解释
      2分钟内完成全流程
    六大下游应用
      文献综述自动生成
      研究思路落地性评估
      创新点生成 含新颖性调节
      研究趋势预测
      相关学者检索
      学者背景画像自动生成
    工程落地
      Python SDK开放访问
      托管API服务
      浙大OpenKG平台集成
      GitHub已获112 Star