{
"success": true,
"data": {
"id": "229defbb-0cee-6f02-673a-5cde290d0673",
"request_id": "eb27e3e4-fdb9-430f-81b1-240d6fa4ef75",
"file_name": "xf59uBNVuQFZOzFcqztKJBLC5iO7FTFwRZXwxRqH",
"page_count": 1,
"total_pages": 1,
"title": "sample",
"pages": [
{
"page_number": 1,
"extraction_method": "text",
"blocks": [
{
"type": "paragraph",
"text": "Sample PDF This is a simple PDF file. Fun fun fun."
},
{
"type": "paragraph",
"text": "Lorem ipsum dolor sit amet, consectetuer adipiscing elit. Phasellus facilisis odio sed mi."
},
{
"type": "paragraph",
"text": "Curabitur suscipit. Nullam vel nisi. Etiam semper ipsum ut lectus. Proin aliquam, erat eget pharetra commodo, eros mi condimentum quam, sed commodo justo quam ut velit."
},
{
"type": "paragraph",
"text": "Integer a erat. Cras laoreet ligula cursus enim. Aenean scelerisque velit et tellus."
},
{
"type": "paragraph",
"text": "Vestibulum dictum aliquet sem. Nulla facilisi. Vestibulum accumsan ante vitae elit. Nulla erat dolor, blandit in, rutrum quis, semper pulvinar, enim. Nullam varius congue risus."
},
{
"type": "paragraph",
"text": "Vivamus sollicitudin, metus ut interdum eleifend, nisi tellus pellentesque elit, tristique accumsan eros quam et risus. Suspendisse libero odio, mattis sit amet, aliquet eget, hendrerit vel, nulla. Sed vitae augue. Aliquam erat volutpat. Aliquam feugiat vulputate nisl."
},
{
"type": "paragraph",
"text": "Suspendisse quis nulla pretium ante pretium mollis. Proin velit ligula, sagittis at, egestas a, pulvinar quis, nisl."
},
{
"type": "paragraph",
"text": "Pellentesque sit amet lectus. Praesent pulvinar, nunc quis iaculis sagittis, justo quam lobortis tortor, sed vestibulum dui metus venenatis est. Nunc cursus ligula. Nulla facilisi."
},
{
"type": "paragraph",
"text": "Phasellus ullamcorper consectetuer ante. Duis tincidunt, urna id condimentum luctus, nibh ante vulputate sapien, id sagittis massa orci ut enim. Pellentesque vestibulum convallis sem. Nulla consequat quam ut nisl. Nullam est. Curabitur tincidunt dapibus lorem. Proin velit turpis, scelerisque sit amet, iaculis nec, rhoncus ac, ipsum. Phasellus lorem arcu, feugiat eu, gravida eu, consequat molestie, ipsum. Nullam vel est ut ipsum volutpat feugiat. Aenean pellentesque."
},
{
"type": "paragraph",
"text": "In mauris. Pellentesque dui nisi, iaculis eu, rhoncus in, venenatis ac, ante. Ut odio justo, scelerisque vel, facilisis non, commodo a, pede. Cras nec massa sit amet tortor volutpat varius. Donec lacinia, neque a luctus aliquet, pede massa imperdiet ante, at varius lorem pede sed sapien. Fusce erat nibh, aliquet in, eleifend eget, commodo eget, erat. Fusce consectetuer. Cras risus tortor, porttitor nec, tristique sed, convallis semper, eros. Fusce vulputate ipsum a mauris. Phasellus mollis. Curabitur sed urna. Aliquam nec sapien non nibh pulvinar convallis. Vivamus facilisis augue quis quam. Proin cursus aliquet metus."
},
{
"type": "paragraph",
"text": "Suspendisse lacinia. Nulla at tellus ac turpis eleifend scelerisque. Maecenas a pede vitae enim commodo interdum. Donec odio. Sed sollicitudin dui vitae justo."
},
{
"type": "paragraph",
"text": "Morbi elit nunc, facilisis a, mollis a, molestie at, lectus. Suspendisse eget mauris eu tellus molestie cursus. Duis ut magna at justo dignissim condimentum. Cum sociis natoque penatibus et magnis dis parturient montes, nascetur ridiculus mus. Vivamus varius. Ut sit amet diam suscipit mauris ornare aliquam. Sed varius. Duis arcu. Etiam tristique massa eget dui. Phasellus congue. Aenean est erat, tincidunt eget, venenatis quis, commodo at, quam."
}
]
}
]
}
}
curl --location 'https://zylalabs.com/api/14067/pdf+to+json+ocr+api/34500/convert+pdf-to-json?ocr=auto' \
--header 'Content-Type: application/json' \
--form 'image=@"FILE_PATH"'
注册后,每个开发者都会被分配一个个人 API 访问密钥,这是一个唯一的字母和数字组合,用于访问我们的 API 端点。要使用 PDF 转 JSON OCR API 进行身份验证,只需在 Authorization 标头中包含您的 bearer token。
| 标头 | 描述 |
|---|---|
授权
|
必需
应为 Bearer access_key. 订阅后,请查看上方的"您的 API 访问密钥"。
|
无长期承诺。随时升级、降级或取消。 免费试用包括最多 50 个请求。
(年度计费可节省 2 个月 🎉)
将任何带或不带图像的PDF文档转换为结构化的JSON输出,利用API内置的OCR功能。该API最适合用于LLM训练和数据集创建
转换PDF为JSON端点返回包含从输入PDF中提取的文本、图像和元数据的结构化JSON数据它将这些信息组织成层次格式,便于访问和处理
响应中的关键字段包括“成功”“数据”“id”“请求_id”“文件名”“页面数”“总页数”和“页面”,其中包含每页内容和结构的详细信息
响应数据以JSON对象的形式组织,顶层的“data”字段包含一个“pages”数组。每个页面对象包括“page_number”,“extraction_method”和“blocks”,详细说明内容类型和文本
主要参数是“OCR”,可以设置为true以强制执行OCR处理,或设置为自动以进行自动检测。这允许用户自定义如何从基于图像的PDF中提取文本
转换端点的 HTML 页面处理原始 HTML 内容,并以各种格式返回,例如 PDF 或 DOCX 它从 HTML 中提取文本、图像和格式,使用户能够将网页内容转换为结构化文档
典型的用例包括将PDF报告、发票和合同转换为JSON以进行数据分析、与Web应用集成以及为机器学习模型训练准备数据集
用户可以解析 JSON 响应以提取特定内容,例如标题或段落,以便进一步分析或集成到应用程序中 结构化格式允许轻松操作和数据处理
该API使用内置的OCR技术准确提取PDF中的文本,包括带有图像的PDF。持续更新和改进OCR算法有助于保持高数据质量和准确性