{"status":"success","response_data":[["Apple","appl!e",1.0]]}
curl --location --request POST 'https://zylalabs.com/api/11915/real+time+similarity+api/22652/dedupe?data=["Apple", "appl!e"]' --header 'Authorization: Bearer YOUR_API_KEY'
注册后,每个开发者都会被分配一个个人 API 访问密钥,这是一个唯一的字母和数字组合,用于访问我们的 API 端点。要使用 实时相似性 API 进行身份验证,只需在 Authorization 标头中包含您的 bearer token。
| 标头 | 描述 |
|---|---|
授权
|
必需
应为 Bearer access_key. 订阅后,请查看上方的"您的 API 访问密钥"。
|
实时相似性API是一个高速模糊匹配和去重API,旨在处理真实世界中的混乱数据。它帮助您识别近似重复的记录,并在值不完全匹配时 reconciliate 实体—拼写错误、大小写差异、缺失的标点、空格问题、缩写和轻微的词序变化。
与其构建和调整自己的模糊匹配管道,不如将字符串(或记录)发送到API,并获取您可以信任的相似性评分的匹配结果。典型输出包括匹配对(例如,“苹果”⇔“苹果公司”)、相似性分数和易于融入数据清理工作流、客户关系管理系统、ETL作业和分析管道的结构化结果。
常见用例:
去重列表:在数据集中查找重复项(全对全匹配)并返回可能的重复对。
与主列表进行对比:将入站列表与标准集进行匹配(列表对主列表)。
客户关系管理和客户数据清理:清理导致报告和外展破坏的潜在重复的潜在客户/账户/公司。
实体解决与记录关联:在不同来源中连接对同一真实世界实体的引用。
团队使用它的原因:
开箱即用处理混乱文本(无需为每个边缘案例手动制定规则)
用于排名和阈值的相似性分数(您可以选择严格程度)
为规模和自动化而构建(设计用于管道中运行,而不仅仅是一次性脚本)
Dedupe端点返回一个JSON对象,其中包含匹配的字符串对、相似度得分和可选的去重结果。根据指定的配置,输出可以格式化为字符串对、索引对或去重字符串
响应数据的关键字段包括“状态”(表示成功或错误)和“响应数据”,其中包含根据用户请求格式化的结果,例如匹配的对或去重的字符串
用户可以通过调整“config”对象中的参数来定制请求,例如用于匹配严格性的“similarity_threshold”、用于预处理的“remove_punctuation”以及选择所需结果结构的“output_format”
响应数据组织为结果数组,每个条目对应于一个匹配或去重字符串 根据输出格式,条目可能包括原始字符串、索引和相似性评分,便于轻松集成到工作流程中
典型用例包括去重客户列表 将记录与主列表对账 清理CRM数据 和在不同数据源之间执行实体解析 以确保数据完整性和准确性
数据准确性通过先进的模糊匹配算法得以维持,这些算法考虑了常见的数据问题,如拼写错误和大小写差异。该API旨在有效处理混乱数据,确保可靠的匹配结果
接受的参数值包括“similarity_threshold”(0到1)、“remove_punctuation”(布尔值)、“to_lowercase”(布尔值)、“use_token_sort”(布尔值)和“top_k”(整数或“all”)。这些参数允许用户根据他们的特定需求定制匹配过程
如果去重接口返回部分或空结果,用户应检查输入数据是否存在质量问题,例如过多的重复项或非常低的相似度阈值 调整“相似度阈值”或审查输入列表可以帮助改善结果