典型用户
科研文献管理员 / AI 应用工程师
高校实验室、企业研究院
批量解析英文 PDF 论文,构建可 citation 追溯的结构化知识库
业务挑战
- ·双栏排版导致块顺序与单栏 OCR 完全不同
- ·摘要、章节标题、参考文献需不同块类型
- ·英文 OCR 与公式、图表 caption 混合
- ·6 页 PDF 需异步解析,避免同步超时
DocParse4AI 如何解决
- ✓PDF 走 async 接口,worker 集群横向扩展
- ✓title / text / figure / reference 分块,支持目录树导航
- ✓Markdown 输出可直接 chunk 入向量库
- ✓95 blocks / 6 pages 预处理结果可完整预览
实施流程
- 1
论文采集
arXiv / 期刊 PDF 批量入库
- 2
异步解析
POST /parse/async,output_formats=markdown,json
- 3
分块索引
按 blocks 切分 embedding,保留 page_num + bbox
- 4
问答溯源
RAG 返回答案时引用 block bbox 定位原文
真实测试样张(可即时体验)
以下样张均已生成预处理 JSON,Playground 点击即可展示 bbox 与 Markdown,无需等待 API 解析。
计算机视觉论文 PDF
《Real-time Temporal Stereo Matching using Iterative Adaptive Support Weights》· 6 页英文双栏论文,含摘要与参考文献
- ✓ 双栏排版
- ✓ 摘要/参考文献
- ✓ 英文 OCR
scene=general异步解析统计论文附录 PDF
《Assessing the Treatment Effect Heterogeneity with a Latent Variable》附录 · 18 页因果推断证明,含大量 LaTeX 公式(文件名 invoice.pdf 为历史命名,非金融单据)
- ✓ 18 页长 PDF
- ✓ 公式块识别
- ✓ 附录证明结构
scene=general异步解析已验证能力
- 英文双栏正文阅读顺序
- Abstract 与章节 title 识别
- figure + caption 块
- 6 页 PDF 异步预处理完成
API 接入示例
curl -X POST https://www.docparse4ai.com/api/v1/parse/async \ -F "file=@your-document.pdf" \ -F "api_key=sk-your-key" \ -F "scene=general" \ -F "output_formats=markdown" \ -F "output_formats=json"
相关案例
K12 教育对比测试 #1, #2, #3K12 教辅数字化:从扫描页到可编排题库
教研团队需要将扫描版教辅 PDF 转为可检索、可切题、可挂接知识点的结构化数据。对比测试 3 张真实教辅页验证 K12 场景下的公式、插图与层级标题识别。
阅读故事 · 3 个真实样张可体验 →
金融投研对比测试 #4, #5, #6上市公司年报解析:万科财报真实页结构化
投研与风控团队从年报 PDF 中抽取表格与关键叙述。使用万科 2025 年度报告真实截图(3 页)验证带表研报的表格 Markdown 与字段对齐能力。
阅读故事 · 3 个真实样张可体验 →
数字出版对比测试 #7, #8杂志多栏排版数字化:《读者》复杂版式还原
内容平台将纸质杂志扫描件转为可 TTS、可搜索的数字内容。《读者》2010 年第 6 期 P16、P29 两页用于验证多栏阅读顺序与图文混排。
阅读故事 · 2 个真实样张可体验 →