{
"success": true,
"data": {
"id": "229defbb-0cee-6f02-673a-5cde290d0673",
"request_id": "eb27e3e4-fdb9-430f-81b1-240d6fa4ef75",
"file_name": "xf59uBNVuQFZOzFcqztKJBLC5iO7FTFwRZXwxRqH",
"page_count": 1,
"total_pages": 1,
"title": "sample",
"pages": [
{
"page_number": 1,
"extraction_method": "text",
"blocks": [
{
"type": "paragraph",
"text": "Sample PDF This is a simple PDF file. Fun fun fun."
},
{
"type": "paragraph",
"text": "Lorem ipsum dolor sit amet, consectetuer adipiscing elit. Phasellus facilisis odio sed mi."
},
{
"type": "paragraph",
"text": "Curabitur suscipit. Nullam vel nisi. Etiam semper ipsum ut lectus. Proin aliquam, erat eget pharetra commodo, eros mi condimentum quam, sed commodo justo quam ut velit."
},
{
"type": "paragraph",
"text": "Integer a erat. Cras laoreet ligula cursus enim. Aenean scelerisque velit et tellus."
},
{
"type": "paragraph",
"text": "Vestibulum dictum aliquet sem. Nulla facilisi. Vestibulum accumsan ante vitae elit. Nulla erat dolor, blandit in, rutrum quis, semper pulvinar, enim. Nullam varius congue risus."
},
{
"type": "paragraph",
"text": "Vivamus sollicitudin, metus ut interdum eleifend, nisi tellus pellentesque elit, tristique accumsan eros quam et risus. Suspendisse libero odio, mattis sit amet, aliquet eget, hendrerit vel, nulla. Sed vitae augue. Aliquam erat volutpat. Aliquam feugiat vulputate nisl."
},
{
"type": "paragraph",
"text": "Suspendisse quis nulla pretium ante pretium mollis. Proin velit ligula, sagittis at, egestas a, pulvinar quis, nisl."
},
{
"type": "paragraph",
"text": "Pellentesque sit amet lectus. Praesent pulvinar, nunc quis iaculis sagittis, justo quam lobortis tortor, sed vestibulum dui metus venenatis est. Nunc cursus ligula. Nulla facilisi."
},
{
"type": "paragraph",
"text": "Phasellus ullamcorper consectetuer ante. Duis tincidunt, urna id condimentum luctus, nibh ante vulputate sapien, id sagittis massa orci ut enim. Pellentesque vestibulum convallis sem. Nulla consequat quam ut nisl. Nullam est. Curabitur tincidunt dapibus lorem. Proin velit turpis, scelerisque sit amet, iaculis nec, rhoncus ac, ipsum. Phasellus lorem arcu, feugiat eu, gravida eu, consequat molestie, ipsum. Nullam vel est ut ipsum volutpat feugiat. Aenean pellentesque."
},
{
"type": "paragraph",
"text": "In mauris. Pellentesque dui nisi, iaculis eu, rhoncus in, venenatis ac, ante. Ut odio justo, scelerisque vel, facilisis non, commodo a, pede. Cras nec massa sit amet tortor volutpat varius. Donec lacinia, neque a luctus aliquet, pede massa imperdiet ante, at varius lorem pede sed sapien. Fusce erat nibh, aliquet in, eleifend eget, commodo eget, erat. Fusce consectetuer. Cras risus tortor, porttitor nec, tristique sed, convallis semper, eros. Fusce vulputate ipsum a mauris. Phasellus mollis. Curabitur sed urna. Aliquam nec sapien non nibh pulvinar convallis. Vivamus facilisis augue quis quam. Proin cursus aliquet metus."
},
{
"type": "paragraph",
"text": "Suspendisse lacinia. Nulla at tellus ac turpis eleifend scelerisque. Maecenas a pede vitae enim commodo interdum. Donec odio. Sed sollicitudin dui vitae justo."
},
{
"type": "paragraph",
"text": "Morbi elit nunc, facilisis a, mollis a, molestie at, lectus. Suspendisse eget mauris eu tellus molestie cursus. Duis ut magna at justo dignissim condimentum. Cum sociis natoque penatibus et magnis dis parturient montes, nascetur ridiculus mus. Vivamus varius. Ut sit amet diam suscipit mauris ornare aliquam. Sed varius. Duis arcu. Etiam tristique massa eget dui. Phasellus congue. Aenean est erat, tincidunt eget, venenatis quis, commodo at, quam."
}
]
}
]
}
}
curl --location 'https://zylalabs.com/api/14067/pdf+to+json+ocr+api/34500/convert+pdf-to-json?ocr=auto' \
--header 'Content-Type: application/json' \
--form 'image=@"FILE_PATH"'
Após se cadastrar, cada desenvolvedor recebe uma chave de acesso à API pessoal, uma combinação única de letras e dígitos para acessar nosso endpoint de API. Para autenticar com a PDF para JSON OCR API basta incluir seu token Bearer no cabeçalho Authorization.
| Cabeçalho | Descrição |
|---|---|
Authorization
|
Obrigatório
Deve ser Bearer access_key. Veja "Sua chave de acesso à API" acima quando você estiver inscrito.
|
Sem compromisso de longo prazo. Faça upgrade, downgrade ou cancele a qualquer momento. O teste gratuito inclui até 50 requisições.
(Economize 2 meses com cobrança anual 🎉)
Converta qualquer documento PDF com ou sem imagens em uma saída JSON estruturada com os recursos de OCR integrados da API A API é mais adequada para treinamento de LLM e criação de conjuntos de dados
O endpoint Converter PDF-para-JSON retorna dados JSON estruturados que incluem texto extraído, imagens e metadados do PDF de entrada Ele organiza essas informações em um formato hierárquico, facilitando o acesso e a manipulação
Os campos-chave na resposta incluem "sucesso", "dados", "id", "id_da_solicitação", "nome_do_arquivo", "contagem_de_páginas", "total_de_páginas" e "páginas", que contêm informações detalhadas sobre o conteúdo e a estrutura de cada página
Os dados da resposta estão organizados em um objeto JSON, com um campo de nível superior "data" contendo um array de "páginas" Cada objeto de página inclui "número_da_página," "método_de_extracção" e "blocos" que detalham o tipo de conteúdo e o texto
O parâmetro principal é "OCR" que pode ser definido como verdadeiro para forçar o processamento de OCR ou deixado como automático para detecção automática Isso permite que os usuários personalizem como o texto é extraído de PDFs baseados em imagem
A página HTML para o ponto de conversão processa conteúdo HTML bruto e o retorna em vários formatos como PDF ou DOCX Ela extrai texto imagens e formatação do HTML permitindo que os usuários convertem conteúdo da web em documentos estruturados
Os casos de uso típicos incluem transformar relatórios em PDF faturas e contratos em JSON para análise de dados integrar-se com aplicações web e preparar conjuntos de dados para treinamento de modelos de aprendizado de máquina
Os usuários podem analisar a resposta JSON para extrair conteúdo específico, como títulos ou parágrafos, para análise adicional ou integração em aplicações. O formato estruturado permite fácil manipulação e processamento de dados
A API utiliza tecnologia OCR embutida para extrair texto com precisão de PDFs, incluindo aqueles com imagens Atualizações e melhorias contínuas nos algoritmos de OCR ajudam a manter alta qualidade e precisão dos dados