{
"success": true,
"data": {
"id": "229defbb-0cee-6f02-673a-5cde290d0673",
"request_id": "eb27e3e4-fdb9-430f-81b1-240d6fa4ef75",
"file_name": "xf59uBNVuQFZOzFcqztKJBLC5iO7FTFwRZXwxRqH",
"page_count": 1,
"total_pages": 1,
"title": "sample",
"pages": [
{
"page_number": 1,
"extraction_method": "text",
"blocks": [
{
"type": "paragraph",
"text": "Sample PDF This is a simple PDF file. Fun fun fun."
},
{
"type": "paragraph",
"text": "Lorem ipsum dolor sit amet, consectetuer adipiscing elit. Phasellus facilisis odio sed mi."
},
{
"type": "paragraph",
"text": "Curabitur suscipit. Nullam vel nisi. Etiam semper ipsum ut lectus. Proin aliquam, erat eget pharetra commodo, eros mi condimentum quam, sed commodo justo quam ut velit."
},
{
"type": "paragraph",
"text": "Integer a erat. Cras laoreet ligula cursus enim. Aenean scelerisque velit et tellus."
},
{
"type": "paragraph",
"text": "Vestibulum dictum aliquet sem. Nulla facilisi. Vestibulum accumsan ante vitae elit. Nulla erat dolor, blandit in, rutrum quis, semper pulvinar, enim. Nullam varius congue risus."
},
{
"type": "paragraph",
"text": "Vivamus sollicitudin, metus ut interdum eleifend, nisi tellus pellentesque elit, tristique accumsan eros quam et risus. Suspendisse libero odio, mattis sit amet, aliquet eget, hendrerit vel, nulla. Sed vitae augue. Aliquam erat volutpat. Aliquam feugiat vulputate nisl."
},
{
"type": "paragraph",
"text": "Suspendisse quis nulla pretium ante pretium mollis. Proin velit ligula, sagittis at, egestas a, pulvinar quis, nisl."
},
{
"type": "paragraph",
"text": "Pellentesque sit amet lectus. Praesent pulvinar, nunc quis iaculis sagittis, justo quam lobortis tortor, sed vestibulum dui metus venenatis est. Nunc cursus ligula. Nulla facilisi."
},
{
"type": "paragraph",
"text": "Phasellus ullamcorper consectetuer ante. Duis tincidunt, urna id condimentum luctus, nibh ante vulputate sapien, id sagittis massa orci ut enim. Pellentesque vestibulum convallis sem. Nulla consequat quam ut nisl. Nullam est. Curabitur tincidunt dapibus lorem. Proin velit turpis, scelerisque sit amet, iaculis nec, rhoncus ac, ipsum. Phasellus lorem arcu, feugiat eu, gravida eu, consequat molestie, ipsum. Nullam vel est ut ipsum volutpat feugiat. Aenean pellentesque."
},
{
"type": "paragraph",
"text": "In mauris. Pellentesque dui nisi, iaculis eu, rhoncus in, venenatis ac, ante. Ut odio justo, scelerisque vel, facilisis non, commodo a, pede. Cras nec massa sit amet tortor volutpat varius. Donec lacinia, neque a luctus aliquet, pede massa imperdiet ante, at varius lorem pede sed sapien. Fusce erat nibh, aliquet in, eleifend eget, commodo eget, erat. Fusce consectetuer. Cras risus tortor, porttitor nec, tristique sed, convallis semper, eros. Fusce vulputate ipsum a mauris. Phasellus mollis. Curabitur sed urna. Aliquam nec sapien non nibh pulvinar convallis. Vivamus facilisis augue quis quam. Proin cursus aliquet metus."
},
{
"type": "paragraph",
"text": "Suspendisse lacinia. Nulla at tellus ac turpis eleifend scelerisque. Maecenas a pede vitae enim commodo interdum. Donec odio. Sed sollicitudin dui vitae justo."
},
{
"type": "paragraph",
"text": "Morbi elit nunc, facilisis a, mollis a, molestie at, lectus. Suspendisse eget mauris eu tellus molestie cursus. Duis ut magna at justo dignissim condimentum. Cum sociis natoque penatibus et magnis dis parturient montes, nascetur ridiculus mus. Vivamus varius. Ut sit amet diam suscipit mauris ornare aliquam. Sed varius. Duis arcu. Etiam tristique massa eget dui. Phasellus congue. Aenean est erat, tincidunt eget, venenatis quis, commodo at, quam."
}
]
}
]
}
}
curl --location 'https://zylalabs.com/api/14067/pdf+to+json+ocr+api/34500/convert+pdf-to-json?ocr=auto' \
--header 'Content-Type: application/json' \
--form 'image=@"FILE_PATH"'
Después de registrarte, a cada desarrollador se le asigna una clave de acceso a la API personal, una combinación única de letras y dígitos proporcionada para acceder a nuestro endpoint de la API. Para autenticarte con el PDF a JSON OCR API simplemente incluye tu token de portador en el encabezado de Autorización.
| Encabezado | Descripción |
|---|---|
Autorización
|
Requerido
Debería ser Bearer access_key. Consulta "Tu Clave de Acceso a la API" arriba cuando estés suscrito.
|
Sin compromiso a largo plazo. Mejora, reduce o cancela en cualquier momento. La Prueba Gratuita incluye hasta 50 solicitudes.
(Ahorra 2 meses pagando anualmente 🎉)
Convierte cualquier documento PDF con o sin imágenes en una salida JSON estructurada con las funciones de OCR integradas de la API La API es más adecuada para el entrenamiento de LLM y la creación de conjuntos de datos
El endpoint Convert PDF-to-JSON devuelve datos JSON estructurados que incluyen texto extraído, imágenes y metadatos del PDF de entrada. Organiza esta información en un formato jerárquico, facilitando su acceso y manipulación
Los campos clave en la respuesta incluyen "éxito" "datos" "id" "id_solicitud" "nombre_archivo" "número_páginas" "total_páginas" y "páginas" que contienen información detallada sobre el contenido y la estructura de cada página
Los datos de respuesta están organizados en un objeto JSON con un campo "data" de nivel superior que contiene un arreglo de "páginas" Cada objeto de página incluye "número_de_página" "método_de_extracción" y "bloques" que detallan el tipo de contenido y el texto
El parámetro principal es "OCR" que se puede configurar como verdadero para forzar el procesamiento de OCR o dejar como automático para detección automática Esto permite a los usuarios personalizar cómo se extrae el texto de los PDFs basados en imágenes
La página HTML para el punto de conversión procesa contenido HTML en bruto y lo devuelve en varios formatos como PDF o DOCX Extrae texto imágenes y formato del HTML lo que permite a los usuarios convertir contenido web en documentos estructurados
Los casos de uso típicos incluyen transformar informes PDF facturas y contratos en JSON para análisis de datos integrar con aplicaciones web y preparar conjuntos de datos para el entrenamiento de modelos de aprendizaje automático
Los usuarios pueden analizar la respuesta JSON para extraer contenido específico como encabezados o párrafos para un análisis adicional o integración en aplicaciones El formato estructurado permite una fácil manipulación y procesamiento de datos
La API emplea tecnología OCR incorporada para extraer con precisión texto de PDFs, incluidos aquellos con imágenes. Actualizaciones continuas y mejoras en los algoritmos de OCR ayudan a mantener alta calidad y precisión de los datos