Skip to content

数据源怎么选:9 个学术源、公共知识库和网络搜索各管什么 ​

确认页的「数据源」一行默认全勾。多数课题保持默认就行,但知道每个源是什么,能解释文献页里「为什么这几篇来自 arXiv、那几篇来自 PubMed」,也能在源限流时判断要不要等。悬停每个源的 chip 能看到一句说明,这一页是展开版。

先说规则 ​

  • 勾选的源与当前档位可用的源取交集;交集为空就用全部可用源。灰色的是当前档位不可用或后台未配置 key 的。
  • 至少保留一个源;但文献阶段有最低源数阈值(专业档 5 个应答源、2 个有命中),勾得太少会先提示「可用的文献库较少」再降阈值跑,覆盖度会打折。
  • 中文检索式只发给 OpenAlex、Semantic Scholar、Crossref;arXiv 遇到纯中文检索式直接跳过,不发请求。
  • 站内公共知识库不在 chips 里,它对每条检索式都先查,不算外部源。
  • 知网 / 万方这类中文库没有接入,中文课题的中文文献主要靠 OpenAlex 与 Crossref 里的元数据。

逐个说 ​

OpenAlex ​

全学科学术元数据库,两亿多条期刊、会议、预印本记录,数据 CC0。免 key,请求带联系邮箱进「礼貌池」,10 rps。它同时承担主检索、引文滚雪球(向前 / 向后)、按 DOI 反查种子文献、领域识别。任何课题都应该留着它,去掉它滚雪球会退到 Semantic Scholar 和 Crossref。中文检索式可用。

Semantic Scholar ​

全学科,计算机与生物医学覆盖最好;提供引用关系、推荐接口和摘要摘句,滚雪球的推荐路径只靠它。有 key 时 1 rps 专属额度;没配 key 走全网共享的匿名池,限速被封顶到 0.3 rps,遇到 429 整个源冷却 10 秒——线上曾出现一天 488 次调用 341 次失败,全是无 key 时的 429。它频繁「暂时不可用」时多半是这个原因,不是你的课题有问题。中文检索式可用。

arXiv ​

物理、数学、计算机、统计、定量生物预印本。更新最快,但未经同行评审,筛入后一律 C 层。限速 1 请求 / 3 秒,是最慢的源之一;PDF 可直接取全文,非 CC 许可证的全文只索引不展示。只认英文检索式。

PubMed ​

MEDLINE 生物医学与生命科学期刊,临床、药学、公共卫生课题的首选。撤稿按出版类型「Retracted Publication」剔除。无 key 3 rps,有 key 10 rps。课题带医学 / 生物 / 临床 / 基因 / 蛋白 / cancer / neuro 这类词时它和 Europe PMC 排最前;非生物医学课题在免费档不会用它,专业档照常包含。

Europe PMC ​

生物医学与生命科学,含开放获取全文和预印本(bioRxiv / medRxiv 的记录在这里以 PPR 形式出现)。与 PubMed 互补,多拿到的是可读全文,许可证按记录自带的 license 字段判。5 rps,免 key。

Crossref ​

DOI 注册机构的元数据,全学科期刊、会议、图书。它的作用主要不是「找新文献」:核对 DOI 是否指向这篇、补全书目、拿参考文献做向后滚雪球、撤稿判定(已并入 Retraction Watch 数据)。按出版社条款不存摘要。50 rps,免 key。中文检索式可用。

OpenAIRE ​

欧洲开放科学聚合库,汇集 Crossref / DataCite / arXiv / 机构库 / DBLP,全学科,适合找开放获取版本与欧盟资助研究。免 key 但匿名额度低,0.5 rps;它的检索接口最多接受 4 个逻辑运算符,复杂检索式会被改写。不做撤稿判定。

DOAJ ​

经审核的开放获取期刊目录,全学科,人文社科覆盖比其它源好;收录的论文都有全文链接,多数是 CC-BY 家族,能站内阅读的比例最高。2 rps,免 key。

CORE ​

全球机构知识库的开放获取全文聚合,适合补全文、学位论文、技术报告。需要 key(免费申请,在管理后台配置),没配时这个源不会出现在可用列表里;免费 key 限非商业用途。0.15 rps,很慢,命中量也不大,把它当补充。

Unpaywall(不是检索源) ​

按 DOI 查找合法的开放获取全文链接,是全文获取链的第一跳,需要邮箱不需要 key。它不参与检索,chips 里不会出现。

公共知识库 ​

之前所有研究筛入并晋升进来的条目,PG 全文检索 + trigram,不经模型。每条检索式都先查它;命中且相关度 ≥ 0.6 的在筛入时先占最多 30% 名额,因为它们已经有全文、实体和引用链。确认页「已经在库里找到的文献」那一栏就是它的预览。

按领域推荐 ​

  • 生物医学 / 临床 / 药学:PubMed + Europe PMC 必留,OpenAlex、Semantic Scholar 补覆盖,Crossref 核对。arXiv 对这类课题几乎没有贡献,可以去掉省时间。
  • 计算机 / AI / 物理 / 统计:arXiv + Semantic Scholar + OpenAlex 是主力,Crossref 补正式发表版本。PubMed 去掉。
  • 人文社科 / 教育 / 管理:OpenAlex + DOAJ + OpenAIRE + Crossref,CORE 有 key 就加上。Semantic Scholar 覆盖一般但引用关系有用。
  • 中文课题:只有 OpenAlex、Semantic Scholar、Crossref 能接中文检索式,其它源靠系统自动补的英文检索式工作;把课题的英文关键词写准比多勾源更有效。

网络搜索源:博查 / Exa 是什么 ​

它们检索的是网页,不是学术文献:新闻、政策、技术报告、产品文档、行业动态。检索计划里会单独列出最多 3 条「只有网络搜索能回答的问题」(web_queries),文献阶段最后一步按语言选源:中文 → 博查,英文 → Exa(Tavily 是英文备选,默认未启用)。每条取 8 条结果,同一域名最多 3 条,总共最多 20 条网页资料,编号 [W n],在文献页「网络资料」标签里,按域名给可信度等级(官方 / 学术站 3 级,可信媒体 4 级,其余 5 级)。网页正文由 Jina Reader 抓取,只进你的私有层,30 天后清理。

网页结果里出现的 DOI / arXiv id 会反查成论文候选,进正常的筛选流程。

什么时候会用到:课题涉及标准、技术报告、产品或行业现状,学术库里查不到的那部分。什么时候不会用:网络源都是付费接口、只对使用已购次数或订阅的研究开放;后台没配 key 时会记一条调整「无可用的网络搜索源」并跳过,报告里不得引用 [W n]。

后台还登记了但没启用的 ​

注册表里另有 bioRxiv / medRxiv 直连、OpenReview(ICLR / NeurIPS 投稿与评审)和模型内置网络搜索三项,当前都是停用状态,chips 里不会出现。bioRxiv / medRxiv 的记录能通过 Europe PMC 拿到。

相关 ​