以版面为先的文档解析
Parse 2.0 被描述为一种以版面为先的解析 API,可识别页面上的有意义区域,并为下游使用保留阅读顺序。
Extend 是一款文档处理平台,可将 PDF 等文档转换为结构化数据,适用于管道和 agent。提供解析、提取、拆分、分类、OCR、工作流工具,并支持自托管部署与访问控制。
Extend 是一款用于将 PDF 和其他源文档转换为结构化数据的文档处理平台。其核心任务是解析、提取、拆分、分类和编辑文档,帮助团队构建可靠的下游管道和 agent。
产品网站将 Parse 2.0 定位为一种以版面为先的解析 API,面向阅读顺序、版面和字段关系都很重要的生产场景。Extend 还提供 OCR、评估工具、工作流编排以及 Studio 界面,帮助团队在上线前迭代 schema 并审查输出。
定价页面显示 Pay As You Go、Scale 和 Enterprise 层级,并提供面向企业的选项,如自托管部署、定制协议、SSO/SAML、高级 RBAC、多个工作区、自定义模型和自定义速率限制。网站还提到支持 25+ 文件类型以及大规模文档处理。
Parse 2.0 被描述为一种以版面为先的解析 API,可识别页面上的有意义区域,并为下游使用保留阅读顺序。
产品页面列出了 Extract、Split、Classify 和 Edit API,覆盖提取、分类、拆分和表单填写工作流。
定价材料描述了 Agentic OCR、高级表格解析、签名检测、复选框检测、边界框、多种分块策略,以及对 25+ 文件类型的支持。
Extend 包括快速模式、低延迟模式和面向准确性的处理方式,因此团队可为不同负载选择合适的权衡。
Studio、Evals、Composer 和 Review Agent 支持在生产前进行架构迭代、评估、提示词优化和审核。
Workflows 以及人工介入支持被列为平台的一部分,用于带验证和路由的多步骤文档管道。
当你需要将杂乱的 PDF、扫描件或表单转换为适合 LLM 的上下文,并为 agent 保留版面和阅读顺序时,可使用 Parse 2.0。
在构建需要路由文档、隔离章节并在大规模下将内容转换为结构化字段的管道时,可使用 Extract、Classify 和 Split。
当领域专家需要在发布前完善 schema、检查输出并捕捉回归时,可使用审核、置信度评分、Studio 和 Evals 工具。
当文档必须留在内部,或组织需要 SSO、RBAC 或定制协议时,可使用企业部署和管理功能。
当文档包含手写内容、复选框、签名、表格或其他复杂页面元素时,可使用 OCR 和表格处理功能。
Extend 提供 Parse、Extract、Split、Classify 和 Edit API,以及平台上的 Studio、Evals、Composer、Review Agent、Agentic OCR 和 Workflows。定价页面显示这些功能可在不同产品层级中使用。
源材料将 Extend 描述为面向需要将 PDF 和其他文档转换为结构化数据的团队的文档处理基础设施,重点涵盖解析、提取、拆分、分类和 OCR。
该平台会从文档中返回适用于 LLM 的 Markdown 和结构化输出。发布材料称 Parse 2.0 会定位有意义的区域,将其路由到专用模型,并在返回清晰输出之前重建阅读顺序。
是的。定价页面提供 Pay As You Go、Scale 和 Enterprise 选项。Enterprise 还包括自托管部署、定制 MSA/DPA/SLAs、SSO 和 SAML、高级 RBAC、多个工作区、自定义模型以及自定义速率限制。
入门页面提供了一个演示流程,团队可以在预约演示前分享公司信息、每月文档量,并可选上传一份文档供审核。