论文综述:SciAtlas 面向自动化科研的大规模知识图谱
SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research
📄 查看原文 →一、论文是干什么的?
知识图谱是什么?把图书馆里每本书不只按类别摆放,还用绳子把互相有关系的书连接起来——谁引用了谁、谁研究同一概念……形成一张”知识网络”。基本单元是三元组:(实体A,关系,实体B),例如”论文甲→引用→论文乙”。
现有学术搜索工具的不足:
- Google Scholar:关键词匹配,浅表且会漏掉使用不同术语的相关论文
- Semantic Scholar:语义向量搜索,稍好但仍是”平面化”比较,无法理解”A引用了B,B又影响了C”这种深层逻辑关联
AI 科研助手的困境: 缺乏结构化知识地图作为锚点,AI 在探索复杂文献关系时容易产生”幻觉式引用”,而且每次搜索都需要 LLM 反复迭代,成本高昂。
SciAtlas 提供一张确定性的、结构化的”认知地图”,让 AI 代理在科研中有据可查。
二、核心方法与创新
图谱构建
原始数据来自 OpenAlex(开源学术数据库,4.8 亿论文),筛出 4300 万篇高质量英文论文,覆盖 26 个学科。
用 Qwen3-30B-A3B-Instruct(MoE 架构,激活仅 3B 参数)从每篇摘要提取 3–8 个核心关键词,形成 376 万关键词节点。再用 bge-large-en-v1.5 将标题和摘要编码为 1024 维语义向量,存入 Neo4j 图数据库。
图谱规模:
| 指标 | 数量 |
|---|---|
| 论文节点 | 4330 万篇 |
| 作者节点 | 1.097 亿 |
| 关键词节点 | 376 万 |
| 机构节点 | 12 万 |
| 总关系数 | 30 亿条 |
| 引用关系 | 2.14 亿 |
三路径协同召回 + 图重排序
普通搜索是”找距离最近的点”,SciAtlas 则是”考虑道路连通性,找真正最容易到达的目的地”。
检索时三条路同时走:
- 路径一:关键词匹配 — 从查询中提取关键词,在图谱关键词节点做精确和语义近似匹配(阈值 0.7)
- 路径二:语义向量搜索 — 查询转为 1024 维向量,分别基于标题和摘要向量检索候选,用 bge-reranker-large 重排序,按标题得分和摘要得分以 0.4:0.6 的比例加权合并
- 路径三:标题精确匹配 — 处理含具体论文标题或参考文献的查询
三路合并后,从种子节点出发做 2跳随机游走,沿引用边、关键词共现边探索”隐性关联论文”。最终排序综合三个因子:相关性(权重 0.35)+ 图拓扑支持度(权重 0.45)+ 引用影响力(权重 0.20)。
整个检索在 2 分钟内完成。
三、使用了哪些模型和计算资源?
| 组件 | 模型 |
|---|---|
| 关键词提取 | Qwen3-30B-A3B-Instruct(MoE,激活 3B) |
| 语义嵌入 | bge-large-en-v1.5(北京智源研究院) |
| 重排序 | bge-reranker-large |
| 图数据库 | Neo4j(支持 Cypher 查询 + 1024 维向量索引) |
构建基础设施: 暂无相关信息(处理 4300 万篇论文、构建 30 亿关系的规模极大,具体服务器和 GPU 配置未公开)。
使用方式: 用户无需本地 GPU,通过 http://scinet.openkg.cn API 访问即可,pip 安装轻量客户端即可调用。
四、实验结果
需要特别说明:论文 v1 版本仅有定性分析和案例演示,没有与 Google Scholar、Semantic Scholar 等工具的系统性量化对比。 作者在”局限性”一节坦承,构建量化评测基准是首要的未来工作。
目前可量化的信息:检索速度在 2 分钟内完成,覆盖 4300 万论文、26 个学科。
五、潜在应用与已落地应用
已开放:
- GitHub 开源仓库(zjunlp/SciAtlas),已有 112 颗星,Python SDK 可 pip 安装
- 托管 API(scinet.openkg.cn),注册 Token 即可调用,无需本地部署
- 已整合进浙大 SciGraph 开放知识图谱平台(scigraph.openkg.cn)
六大应用场景:
- 文献综述自动化 — 输入研究方向,自动检索最相关论文,生成综述报告
- 研究想法定位 — 检验某个想法是否已有先行研究,找出创新点
- 想法生成 — 以某篇论文为锚点,探索周边知识空间,触发跨领域创新
- 研究趋势预测 — 分析某方向的论文时间序列,总结演进轨迹
- 相关作者检索 — 找到在特定方向上最具影响力的研究者
- 学者背景画像 — 根据作者所有论文自动生成研究轨迹报告
六、网络上的讨论与评价
论文于 2026 年 5 月 20 日发布,GitHub 仓库已有 112 颗星和 7 个 Fork,表明社区已有初步关注,但尚未形成大规模讨论。已被整合进浙大 OpenKG 平台,说明有机构层面的持续投入。
团队背景: 来自浙江大学 ZJUNLP 实验室,负责人陈华钧教授和张宁豫副教授是知识图谱与 NLP 领域高产研究者,代表性工作包括 EasyEdit(ACL 2024 知识编辑框架)和 AutoKG(用 LLM 自动构建知识图谱)。
客观评估: 论文的方法论设计完整,工程落地扎实(Neo4j + Python SDK + 托管 API)。主要局限是 v1 版本缺乏量化基准——在拿出与现有工具的严格量化对比之前,实际效果仍需进一步验证。适合当前用于快速获取某研究方向的文献全貌,或为 AI 科研代理提供结构化知识基础。
七、思维导图
mindmap
root((SciAtlas))
知识图谱规模
数据来源 OpenAlex 43.3M篇论文
图谱规模
157M个实体节点
30亿条三元组关系
9种实体类型 12种关系类型
部署 Neo4j图数据库
关键词提取 Qwen3-30B 每篇3至8个关键词
语义嵌入 bge-large-en-v1.5 1024维
覆盖标题 摘要 关键词
三路径协同召回
路径一 关键词匹配
精确匹配得分 score_exact = LLM相关性分s_llm
向量匹配得分 score_vec = s_llm乘相似度
关键词阈值 θ_kw = 0.7
路径二 语义检索
bge-large-en-v1.5初始召回Top-60
bge-reranker-large重排至Top-15
得分 0.4乘标题分 + 0.6乘摘要分
路径三 标题匹配
得分 0.65乘序列相似度 + 0.35乘token重叠率
图传播算法
带重启的随机游走 Random Walk with Restart
转移概率 P(v|u) = 边权重除以邻居权重总和
迭代公式 r_v_t+1 = α乘s_v + 1-α乘邻居传播
重启概率 α = 0.15
收敛条件 L1变化小于1e-6 或最多50次迭代
边权重配置
HAS_KEYWORD边 ω = 1.20 乘 κ 乘 rel
κ为关键词稀有度加权
CITES引用边 ω = 1.00
COAUTHOR合作边 ω = β 乘 max(1, log(1+n))
COOCCUR共现边 ω = β 乘 max(1, log(1+n))
对数频率平滑避免高频关系主导
最终排名公式
s_final = 0.35乘预检索分 + 0.45乘图传播分乘门控 + 0.20乘影响力分
图支撑门控 g_p = max(0.25, 预检索分)
防止低预检索分文章通过图传播虚假升排
检索性能
每次查询返回Top-20论文
附带详细得分分解和路径解释
2分钟内完成全流程
六大下游应用
文献综述自动生成
研究思路落地性评估
创新点生成 含新颖性调节
研究趋势预测
相关学者检索
学者背景画像自动生成
工程落地
Python SDK开放访问
托管API服务
浙大OpenKG平台集成
GitHub已获112 Star