{"status":"success","response_data":[["Apple","appl!e",1.0]]}
curl --location --request POST 'https://zylalabs.com/api/11917/similarity+api+-+batch+text+similarity+processing/22650/dedupe?data=["Apple", "appl!e"]' --header 'Authorization: Bearer YOUR_API_KEY'
साइन अप करने के बाद, प्रत्येक डेवलपर को एक पर्सनल API एक्सेस की असाइन की जाती है, जो अक्षरों और अंकों का एक यूनिक संयोजन होता है, जिसका उपयोग हमारे API एंडपॉइंट तक पहुंचने के लिए किया जाता है। प्रमाणीकरण के लिए उच्च प्रदर्शन समानता API के साथ बस अपने बेयरर टोकन को Authorization हेडर में शामिल करें।
| हेडर | विवरण |
|---|---|
Authorization
|
आवश्यक
होना चाहिए Bearer access_key. जब आप सब्सक्राइब हों तो ऊपर "Your API Access Key" देखें।
|
कोई लंबी अवधि की प्रतिबद्धता नहीं। कभी भी अपग्रेड, डाउनग्रेड या कैंसल करें। फ्री ट्रायल में 50 रिक्वेस्ट तक शामिल हैं।
उच्च प्रदर्शन समानता API एक उच्च गति धुंधले मिलान और डुप्लिकेट API है, जिसे वास्तविक दुनिया में अव्यवस्थित डेटा के लिए बनाया गया है। यह आपको लगभग दोहराई गई प्रविष्टियों की पहचान करने में मदद करता है और जब मान पूरी तरह से मेल नहीं खाते हैं तो संस्थाओं को समेटता है - वर्तनी की गलतियाँ, मामले के प्रकार में अंतर, लापता विराम चिह्न, स्थान की समस्या, संक्षेपण और हल्की शब्द क्रम में बदलाव
आपको अपने धुंधले मिलान पाइपलाइन का निर्माण और समायोजन करने की आवश्यकता नहीं है, बस स्ट्रिंग (या रिकॉर्ड) API को भेजें और भरोसेमंद समानता स्कोर मिलान परिणाम प्राप्त करें। सामान्य आउटपुट में मिलान जोड़े (उदाहरण के लिए "Apple" ↔ "apple inc."), समानता स्कोर और डेटा सफाई कार्यप्रवाह, CRM, ETL कार्य और विश्लेषण पाइपलाइन में समाहित करने के लिए संरचित परिणाम शामिल हैं
सामान्य उपयोग के मामले:
डुप्लिकेट सूची को हटाना : डेटा सेट में डुप्लिकेट की पहचान करें (पूर्ण मिलान के लिए पूर्ण मिलान) और संभावित डुप्लिकेट जोड़े लौटाएं
मुख्य सूची के साथ संगतता : आने वाली सूची का मानक सेट के साथ मिलान करें (सूची को मुख्य के साथ)
CRM और ग्राहक डेटा का स्वच्छता : संभावित ग्राहकों/खातों/कंपनियों को साफ करें जो डुप्लिकेट के कारण रिपोर्ट और प्रचार में बाधा डालते हैं
संस्थान पहचान और रिकॉर्ड कड़ी : स्रोत में एक ही वास्तविक दुनिया की संस्थाओं के संदर्भों को जोड़ना
टीम इसका उपयोग क्यों करती है:
बिना किसी प्रयास के अव्यवस्थित टेक्स्ट को हैंडल करें (प्रत्येक सीमांकित मामले के लिए नियम मैन्युअल रूप से बनाने की आवश्यकता नहीं है)
रैंकिंग और थ्रेशोल्ड के लिए समानता स्कोर (आप कठोरता का स्तर चुन सकते हैं)
स्केल और स्वचालन के लिए बनाया गया (पाइपलाइन में चलाने के लिए डिज़ाइन किया गया, केवल एक बार के स्क्रिप्ट के लिए नहीं)
डिडुप endpoint एक JSON ऑब्जेक्ट लौटाता है जिसमें मेल खाने वाले स्ट्रिंग्स के जोड़, समानता स्कोर और वैकल्पिक डिडुप्लीकेटेड परिणाम होते हैं आउटपुट को स्ट्रिंग जोड़ों, इंडेक्स जोड़ या डिडुप्लीकेटेड स्ट्रिंग्स के रूप में स्वरूपित किया जा सकता है जो निर्दिष्ट कॉन्फ़िगरेशन पर निर्भर करता है
प्रतिक्रिया डेटा में प्रमुख क्षेत्र "स्थिति" (सफलता या त्रुटि इंगीत करने वाला) और "प्रतिक्रिया_data" शामिल हैं, जिसमें उपयोगकर्ता के अनुरोध के अनुसार स्वरूपित परिणाम होते हैं, जैसे कि मिलान जोड़े या डिडुप्लिकेटेड स्ट्रिंग्स
उपयोगकर्ता "config" ऑब्जेक्ट में पैरामीटर को समायोजित करके अनुरोधों को कस्टमाइज़ कर सकते हैं जैसे "similarity_threshold" मैच की सख्ती के लिए "remove_punctuation" पूर्व-संसाधन के लिए और "output_format" वांछित परिणाम संरचना चुनने के लिए
प्रतिक्रिया डेटा परिणामों के एक एरे के रूप में व्यवस्थित है जहां प्रत्येक प्रविष्टि एक मिलान या डेडुप्लिकेटेड स्ट्रिंग के अनुरूप होती है आउटपुट प्रारूप के आधार पर प्रविष्टियों में मूल स्ट्रिंग्स इंडices और समानता स्कोर शामिल हो सकते हैं जिससे कार्यप्रवाह में आसान एकीकरण की सुविधा मिलती है
विशिष्ट उपयोग के मामलों में ग्राहक सूचियों से डुप्लिकेट निकालना मास्टर सूची के खिलाफ रिकॉर्ड को सामंजस में लाना सीआरएम डेटा को साफ करना और विभिन्न डेटा स्रोतों के बीच इकाई समाधान करना शामिल है ताकि डेटा की पूर्ति और सटीकता सुनिश्चित हो सके
डेटा की सटीकता उन्नत फजी मिलान एल्गोरिदम के माध्यम से बनाए रखी जाती है जो टाइपो और केस में भिन्नताओं जैसी सामान्य डेटा समस्याओं का ध्यान रखती है एपीआई को गंदे डेटा को प्रभावी ढंग से संभालने के लिए डिजाइन किया गया है जो विश्वसनीय मिलान परिणाम सुनिश्चित करता है
स्वीकृत पैरामीटर मानों में "similarity_threshold" (0 से 1), "remove_punctuation" (बूलियन), "to_lowercase" (बूलियन), "use_token_sort" (बूलियन), और "top_k" (पूर्णांक या "all") शामिल हैं ये पैरामीटर उपयोगकर्ताओं को उनके विशिष्ट आवश्यकताओं के अनुसार मिलान प्रक्रिया को अनुकूलित करने की अनुमति देते हैं
यदि ड्यूप एंडपॉइंट आंशिक या खाली परिणाम लौटाता है तो उपयोगकर्ताओं को गुणवत्ता मुद्दों के लिए इनपुट डेटा की जांच करनी चाहिए जैसे अत्यधिक डुप्लिकेट या बहुत कम समानता थ्रेशहोल्ड समायोजित करना समानता थ्रेशहोल्ड या इनपुट सूची की समीक्षा करना परिणामों में सुधार करने में मदद कर सकता है