{"status":"success","response_data":[["Apple","appl!e",1.0]]}
curl --location --request POST 'https://zylalabs.com/api/11917/similarity+api+-+batch+text+similarity+processing/22650/dedupe?data=["Apple", "appl!e"]' --header 'Authorization: Bearer YOUR_API_KEY'
Após se cadastrar, cada desenvolvedor recebe uma chave de acesso à API pessoal, uma combinação única de letras e dígitos para acessar nosso endpoint de API. Para autenticar com a Alta performance de similaridade API basta incluir seu token Bearer no cabeçalho Authorization.
| Cabeçalho | Descrição |
|---|---|
Authorization
|
Obrigatório
Deve ser Bearer access_key. Veja "Sua chave de acesso à API" acima quando você estiver inscrito.
|
Sem compromisso de longo prazo. Faça upgrade, downgrade ou cancele a qualquer momento. O teste gratuito inclui até 50 requisições.
API de similaridade de alto desempenho é uma API de correspondência difusa e desduplicação de alta velocidade, projetada para dados bagunçados no mundo real. Ela ajuda você a identificar registros aproximadamente duplicados e a reconciliar entidades quando os valores não correspondem exatamente - erros de ortografia, diferenças de capitalização, pontuação ausente, problemas com espaços, abreviações e pequenas variações na ordem das palavras
Você não precisa construir e ajustar seu próprio pipeline de correspondência difusa, basta enviar strings (ou registros) para a API e obter resultados de correspondência de pontuação de similaridade confiáveis. A saída típica inclui pares correspondentes (por exemplo, “Apple” ↔ “apple inc.”), pontuação de similaridade e resultados estruturados que são fáceis de integrar a workflows de limpeza de dados, CRM, tarefas de ETL e pipelines de análise
Casos de uso comuns:
Desduplicação de listas: Encontre duplicatas em conjuntos de dados (correspondência total) e retorne pares possíveis de duplicatas
Reconciliação com a lista principal: Corresponder a lista recebida com um conjunto de referência (lista à principal)
Higiene de CRM e dados de clientes: Limpar leads/contas/empresas potenciais que estão bloqueadas em relatórios e promoções devido a duplicatas
Resolução de entidades e linkagem de registros: Conectar referências ao mesmo entidade do mundo real em origens diferentes
Razões pelas quais as equipes o utilizam:
Processamento de texto bagunçado pronto para uso (sem necessidade de criar regras manualmente para cada caso extremo)
Pontuações de similaridade para ranking e limiares (você pode escolher o nível de rigor)
Construído para escala e automação (projetado para rodar em pipelines, e não apenas como scripts pontuais)
O endpoint Dedupe retorna um objeto JSON contendo pares correspondentes de strings, pontuações de similaridade e resultados deduplicados opcionais A saída pode ser formatada como pares de strings, pares de índices ou strings deduplicadas, dependendo da configuração especificada
Os campos principais nos dados de resposta incluem "status" (indicando sucesso ou erro) e "response_data," que contém os resultados formatados de acordo com o pedido do usuário, como pares correspondentes ou strings deduplicadas
Os usuários podem personalizar as solicitações ajustando os parâmetros no objeto "config" como "similarity_threshold" para a rigorosidade da correspondência "remove_punctuation" para pré-processamento e "output_format" para escolher a estrutura de resultado desejada
Os dados da resposta estão organizados como um array de resultados, onde cada entrada corresponde a uma correspondência ou string desduplicada. Dependendo do formato de saída, as entradas podem incluir strings originais, índices e scores de similaridade, facilitando a fácil integração em fluxos de trabalho
Os casos de uso típicos incluem a deduplicação de listas de clientes, a reconciliação de registros com uma lista mestre, a limpeza de dados de CRM e a realização de resolução de entidades entre diferentes fontes de dados para garantir a integridade e a precisão dos dados
A precisão dos dados é mantida por meio de algoritmos avançados de correspondência difusa que levam em conta problemas comuns de dados, como erros de digitação e diferenças de capitalização A API é projetada para lidar com dados desorganizados de maneira eficaz garantindo resultados de correspondência confiáveis
Os valores de parâmetro aceitos incluem "similarity_threshold" (0 a 1), "remove_punctuation" (booleano), "to_lowercase" (booleano), "use_token_sort" (booleano) e "top_k" (inteiro ou "todos"). Esses parâmetros permitem que os usuários personalizem o processo de correspondência de acordo com suas necessidades específicas
Se o endpoint Dedupe retornar resultados parciais ou vazios os usuários devem verificar os dados de entrada em busca de problemas de qualidade como duplicatas excessivas ou limiares de similaridade muito baixos Ajustar o "similarity_threshold" ou revisar a lista de entrada pode ajudar a melhorar os resultados