cito icon

cito

认领

cito 是面向学术论文的程序化搜索服务,结合语义检索与关键词检索,覆盖约 1.48 亿篇本地论文。帮助研究者和开发者按语义或精确术语查找论文,并提供元数据与来源链接。

cito

面向大型本地语料库的学术论文搜索

Cito 是一个快速的学术文献程序化搜索服务。它检索约 1.48 亿篇本地论文的语料库,并将语义检索与关键词检索合并为一个排序结果集,因此用户既可以按含义也可以按精确术语找到论文。

该产品面向那些需要通过 API 而不是浏览器搜索框来可靠发现论文的用户。由于语料库是自托管的,Cito 在查询时不会继承上游速率限制,并且结果来自其自身索引,因此行为可复现。

核心能力

语义论文检索

使用语义匹配在约 1.48 亿篇学术论文中检索,因此即使措辞不同,也能找到相关工作。

关键词检索

在标题和摘要上通过 BM25 搜索,匹配精确术语、行话、作者和缩写,帮助定位准确的论文引用。

混合结果排序

通过互惠排名融合将语义和关键词排名结合起来,更重视在两个系统中都表现良好的论文。

查询模式控制

当工作流只需要一种模式时,可以只使用语义检索器或关键词检索器;文档中公开了 mode=semantic 和 mode=keyword。

确定性本地索引

对同一查询和语料快照获得可复现的排序,查询时不调用第三方 API。

结果元数据与来源链接

接收结构化的论文元数据以及可用时的开放获取 PDF 直链,而不是完整文本托管层。

实际使用场景

  • 基于概念的文献发现

    按概念而不是精确措辞查找奠基论文或某个主题领域,这在你只知道工作背后想法时很有用。

  • 精确术语与行话检索

    搜索包含特定方法、缩写、模型名称或作者术语的论文,并希望精确词项匹配与相关语义结果一起出现。

  • 程序化论文搜索

    使用 API 在应用中构建研究或发现功能,并依赖固定语料快照获得可复现的排序。

  • 论文筛选与阅读工作流

    利用提供的元数据和开放获取 PDF 链接(如存在)从搜索结果进入源论文,完成筛选与阅读流程。

  • 商业或研究再分发

    使用许可条款和归属指南,在产品、数据集或论文中重新发布搜索结果,而不必猜测数据权利。

Pros and Cons

Pros

  • 将语义搜索与关键词搜索整合在一个系统中,可在同一次查询里同时支持更广泛的发现和精确术语查找。
  • 使用自托管语料库和本地索引,文档称这可避免查询时的上游 API 速率限制。
  • 对相同查询与相同快照提供确定性排序,有助于可重复的研究工作流。
  • 在可用时显示结果元数据和开放获取 PDF 链接,使从发现到阅读的流程更顺畅。
  • 基于开放许可数据构建,并清晰说明下游归属要求。

Cons

  • 公开文档和页面未在所提供的定价网址上显示价格详情,因此这里无法获得成本信息。
  • Cito 提供的是元数据和链接,而不是托管的全文;用户仍需前往源出版商或仓库获取论文本身。
  • 所收集证据中的产品界面主要集中在搜索和 API 使用,因此团队协作或集成等更广泛的工作流功能在现有来源中未被记录。

FAQ

Cito 是做什么的?

Cito 是一项面向学术文献的程序化搜索服务。它结合了语义检索和关键词检索,覆盖约 1.48 亿篇本地论文,并将结果融合为一个排序列表。

搜索是如何工作的?

文档说明,Cito 使用 SPECTER2 进行语义检索,并在标题和摘要上使用 BM25 进行关键词检索。你也可以使用 mode=semantic 或 mode=keyword 只运行其中一种模式。

结果包含哪些信息?

Cito 返回的结果包含标题、作者、期刊/会议、发表日期、DOI、引用次数以及摘要等元数据(如有)。当存在开放获取副本时,还会提供指向源站的直接 PDF 链接。

我可以在商业工作中使用 Cito 的结果吗?

可以。许可页面说明,Cito 基于开放许可的学术数据构建,只要保留 API 响应中要求的归属字符串:“Data from Semantic Scholar”,你就可以在商业产品、研究和出版物中使用这些结果。

Cito 是否托管论文全文?

Cito 不会代理或重新托管全文。PDF 链接指向原始出版商或仓库,下载的 PDF 的任何使用都受其来源条款约束。

Quick Facts

类别
开发者工具
主要用途
面向学术论文的语义与关键词搜索
语料库规模
约 1.48 亿篇论文
数据来源
Semantic Scholar 和 OpenAlex
查询行为
本地索引与混合排序
许可
开放许可的学术数据;转发结果需保留归属