{"status":"success","response_data":[["Apple","appl!e",1.0]]}
curl --location --request POST 'https://zylalabs.com/api/11916/preprocessed+record+similarity+api/22653/dedupe?data=["Apple", "appl!e"]' --header 'Authorization: Bearer YOUR_API_KEY'
Após se cadastrar, cada desenvolvedor recebe uma chave de acesso à API pessoal, uma combinação única de letras e dígitos para acessar nosso endpoint de API. Para autenticar com a Semelhança de Registros Pré-processados API basta incluir seu token Bearer no cabeçalho Authorization.
| Cabeçalho | Descrição |
|---|---|
Authorization
|
Obrigatório
Deve ser Bearer access_key. Veja "Sua chave de acesso à API" acima quando você estiver inscrito.
|
Sem compromisso de longo prazo. Faça upgrade, downgrade ou cancele a qualquer momento.
API de Similaridade de Registros Pré-processados é uma API de correspondência difusa e deduplicação de alta velocidade construída para dados reais e desordenados. Ela ajuda você a identificar registros quase duplicados e reconciliar entidades mesmo quando os valores não correspondem exatamente—erros de digitação, diferenças de maiúsculas e minúsculas, pontuação ausente, problemas de espaçamento, abreviações e pequenas mudanças na ordem das palavras.
Em vez de construir e ajustar seu próprio pipeline de correspondência difusa, você envia suas strings (ou registros) para a API e recebe de volta correspondências com pontuação de similaridade em que você pode confiar. As saídas típicas incluem pares correspondentes (por exemplo, “Apple” ↔ “apple inc.”), pontuações de similaridade e resultados estruturados que são fáceis de integrar em fluxos de trabalho de limpeza de dados, CRMs, trabalhos de ETL e pipelines de análise.
Casos de uso comuns:
Deduplicar listas: encontrar duplicatas dentro de um conjunto de dados (correspondência um a um) e retornar pares de duplicação prováveis.
Reconciliar contra uma lista mestre: combinar uma lista de entrada com um conjunto canônico (lista para mestre).
Higiene de dados de CRM e clientes: limpar leads/contas/empresas onde duplicatas quebram relatórios e outreach.
Resolução de entidades & vinculação de registros: conectar referências à mesma entidade do mundo real entre fontes.
Por que as equipes usam:
Funciona com texto desordenado desde o início (sem regras manuais para cada caso extremo)
Pontuações de similaridade para classificação e limites (você escolhe quão rígido ser)
Construído para escala e automação (projetado para rodar em pipelines, não apenas em scripts pontuais)
O endpoint Dedupe retorna um objeto JSON contendo pares de strings correspondentes, pontuações de similaridade e resultados deduplicados opcionais A saída pode ser formatada como pares de strings, pares de índices ou strings deduplicadas, dependendo da configuração especificada
Os campos-chave nos dados de resposta incluem "status" (indicando sucesso ou erro) e "response_data", que contém os resultados formatados de acordo com o pedido do usuário, como pares correspondentes ou strings deduplicadas
Os usuários podem personalizar solicitações ajustando parâmetros no objeto "config" como "similarity_threshold" para a severidade da correspondência "remove_punctuation" para o pré-processamento e "output_format" para escolher a estrutura de resultado desejada
Os dados de resposta estão organizados como um array de resultados, onde cada entrada corresponde a uma correspondência ou string desduplicada. Dependendo do formato de saída, as entradas podem incluir strings originais, índices e pontuações de similaridade, facilitando a integração fácil em fluxos de trabalho
Casos de uso típicos incluem a deduplicação de listas de clientes a reconciliação de registros com uma lista mestre a limpeza de dados de CRM e a realização de resolução de entidades entre diferentes fontes de dados para garantir a integridade e precisão dos dados
A precisão dos dados é mantida por meio de algoritmos avançados de correspondência difusa que levam em conta problemas comuns de dados, como erros de digitação e diferenças de capitalização A API foi projetada para lidar com dados desordenados de forma eficaz, garantindo resultados de correspondência confiáveis
Valores de parâmetros aceitos incluem "similarity_threshold" (0 a 1), "remove_punctuation" (booleano), "to_lowercase" (booleano), "use_token_sort" (booleano) e "top_k" (inteiro ou "todos"). Esses parâmetros permitem que os usuários ajustem o processo de correspondência às suas necessidades específicas
Se o endpoint Dedupe retornar resultados parciais ou vazios os usuários devem verificar os dados de entrada quanto a problemas de qualidade como duplicatas excessivas ou limiares de similaridade muito baixos Ajustar o "similarity_threshold" ou revisar a lista de entrada pode ajudar a melhorar os resultados