डुप्लीकेट लाइनें हटाएँ
किसी लिस्ट से डुप्लीकेट लाइनें हटाएँ, साथ में सॉर्ट करने, व्हाइटस्पेस काटने, केस को नज़रअंदाज़ करने, और ख़ाली लाइनें हटाने के विकल्प। ईमेल लिस्ट, लॉग फ़ाइल, कीवर्ड लिस्ट और CSV कॉलम साफ़ करने के लिए उपयोगी।
- फ़ाइलें कभी आपकी डिवाइस से बाहर नहीं जातीं
- मुफ़्त, बिना साइन-अप
- कोई वॉटरमार्क नहीं
- लोड होने के बाद ऑफ़लाइन भी काम करता है
डुप्लीकेट लाइनें हटाएँ कैसे करें
- 1
अपनी लिस्ट पेस्ट करें
हर लाइन में एक आइटम — ईमेल, URL, कीवर्ड, जो भी हो।
- 2
अपने विकल्प चुनें
सॉर्ट करें, काटें, केस नज़रअंदाज़ करें, या सिर्फ़ वे लाइनें रखें जो एक से ज़्यादा बार आती हैं।
- 3
नतीजा कॉपी करें
हटाई गई लाइनों की गिनती दिखाई जाती है ताकि आपको पता चले कि क्या बदला।
"पहली एंट्री रखना" समझदार डिफ़ॉल्ट क्यों है
जब किसी लिस्ट में एक ही लाइन की कई कॉपी हों, तो यह नियम होना ज़रूरी है कि कौन सी कॉपी बचे, और पहली रखना वह चुनाव है जो मूल लिस्ट के बारे में सबसे ज़्यादा जानकारी बरक़रार रखता है: बचा हुआ क्रम अब भी दर्शाता है कि लिस्ट मूल रूप से कैसे बनाई गई थी, बजाय डीडुप्लिकेशन के क़दम से ही उलट-पुलट होने के। यह उस लिस्ट के लिए ठोस तौर पर मायने रखता है जो शुरुआत में किसी मायने वाले क्रम में थी — कालक्रम से जोड़ी गई एंट्री, या किसी बाहरी प्रोसेस से पहले से सॉर्ट की हुई — जहाँ उस क्रम को छेड़े बिना डीडुप्लिकेट करना नतीजे को उतना ही इस्तेमाल लायक़ बनाए रखता है जितना मूल था, बस दोहराव के बिना।
बाद में सॉर्टिंग चालू करना एक अलग और जान-बूझकर उठाया क़दम है ठीक इसलिए क्योंकि यह उस मूल क्रम को अल्फ़ाबेटिकल क्रम के हक़ में छोड़ देता है, जो सही चुनाव है जब मूल क्रम में बचाने लायक़ कोई मतलब न हो — मसलन कई स्रोतों से आई कोई अस्त-व्यस्त एक्सपोर्ट — और ग़लत चुनाव है जब उसमें था।
"केस नज़रअंदाज़ करें" क्या बदलता है और क्या नहीं
"केस नज़रअंदाज़ करें" सिर्फ़ यह बदलता है कि दो लाइनों की तुलना डुप्लीकेट तय करने के लिए कैसे की जाती है — Apple, APPLE और apple इस सेटिंग के तहत एक ही एंट्री माने जाते हैं, और लिस्ट में जो पहले आई वही बचती है, अपनी मूल कैपिटलाइज़ेशन के साथ बरक़रार। यह सिर्फ़-तुलना वाली सेटिंग है, नॉर्मलाइज़ेशन वाली नहीं: यह टूल कभी किसी बचने वाली लाइन की कैपिटलाइज़ेशन को किसी मानक फ़ॉर्म से मिलाने के लिए दोबारा नहीं लिखता, बस यह तय करता है कि दोहराव ढूँढने के मक़सद से कौन सी लाइनें बराबर गिनी जाएँ।
यह उन लिस्ट के लिए मायने रखता है जो असंगत कैपिटलाइज़ेशन वाले कई स्रोतों से इकट्ठी की गई हों — अलग-अलग फ़ॉर्म से भेजे गए ईमेल पते, अलग-अलग लोगों द्वारा टाइप किए प्रोडक्ट नाम — जहाँ इस सेटिंग के बिना, "John@Example.com" और "john@example.com" को दो अलग एंट्री माना जाता और दोनों बच जातीं, जिससे शुरुआत में डीडुप्लिकेट करने का मक़सद ही बेकार हो जाता।
डुप्लीकेट हटाने की बजाय उन्हें ढूँढना
सिर्फ़ वे लाइनें दिखाने के लिए ऑपरेशन को उल्टा करना जो एक से ज़्यादा बार आईं, इसे एक सफ़ाई टूल से बदलकर ऑडिट टूल बना देता है — यह तब उपयोगी है जब लक्ष्य कोई साफ़ लिस्ट नहीं बल्कि "क्या इस लिस्ट में वाक़ई डुप्लीकेट हैं, और कौन से?" का जवाब है। किसी डेटा-क्वालिटी समस्या की जाँच करते समय यह सबसे उपयोगी मोड है: किसी क्लाइंट लिस्ट में दोहराए गए रिकॉर्ड होने का शक़, कोई कीवर्ड लिस्ट जो शायद ओवरलैप होते स्रोतों से इकट्ठी की गई हो, कोई लॉग फ़ाइल जहाँ दोहराई गई लाइनें एक बार की बजाय बार-बार लॉग हुई किसी असली त्रुटि का संकेत दे सकती हों।
लाइन तुलना करने से पहले व्हाइटस्पेस काटना
दो लाइनें जो देखने में बिल्कुल एक जैसी लगती हैं वे फिर भी डुप्लीकेट के रूप में मेल न खा सकें अगर एक में आँखों को न दिखने वाला अंत का स्पेस या अतिरिक्त टैब कैरेक्टर हो — यह किसी स्प्रेडशीट या टेबल से डेटा कॉपी करने का एक आम नतीजा है, जहाँ सेल पैडिंग कभी-कभी असली व्हाइटस्पेस के रूप में साथ आ जाती है। तुलना करने से पहले हर लाइन को काटना ठीक इसी तरह के झूठे नॉन-डुप्लीकेट को हटा देता है, ऐसी एंट्री पकड़ते हुए जिन्हें कोई इंसानी रिव्यूअर तुरंत एक जैसा कहेगा लेकिन कोई सख़्त कैरेक्टर-दर-कैरेक्टर तुलना नहीं कहेगी।
अक्सर पूछे जाने वाले सवाल
कौन सा डुप्लीकेट रखा जाता है?
पहली बार आई एंट्री, तो बाक़ी बचे सबके लिए मूल क्रम बरक़रार रहता है। अगर आप सॉर्टिंग भी चालू करते हैं, तो बचने वाली लाइनें फिर अल्फ़ाबेटिकल तरीक़े से सॉर्ट होती हैं।
"केस नज़रअंदाज़ करें" असल में क्या करता है?
यह Apple, APPLE और apple को एक ही लाइन मानता है और वह रखता है जो पहले आई — अपनी मूल कैपिटलाइज़ेशन के साथ बरक़रार। यह बदलता है कि क्या डुप्लीकेट गिना जाता है, आउटपुट कैसे लिखा जाता है यह नहीं।
क्या मैं डुप्लीकेट हटाने की बजाय ढूँढ सकता हूँ?
हाँ। "सिर्फ़ डुप्लीकेट दिखाएँ" ऑपरेशन को उल्टा कर देता है और सिर्फ़ वे लाइनें लिस्ट करता है जो एक से ज़्यादा बार आईं — किसी लिस्ट को साफ़ करने की बजाय ऑडिट करने के लिए उपयोगी।
क्या कोई साइज़ सीमा है?
व्यवहार में, कुछ लाख लाइनों तक। सब कुछ आपके ब्राउज़र में काम करता है, तो सीमा किसी अपलोड टोपी की बजाय आपकी डिवाइस की मेमोरी है — और आपका डेटा कभी टैब से बाहर नहीं जाता, जो क्लाइंट लिस्ट के लिए मायने रखता है।
डुप्लीकेट लाइनें हटाएँ के सामान्य काम
आपको यह भी चाहिए हो सकता है
केस कन्वर्टर
टेक्स्ट को हर कैपिटलाइज़ेशन स्टाइल में बदलें
वर्ड काउंटर
टाइप करते समय शब्द, वाक्य और पढ़ने का समय गिनें
CSV से JSON
स्प्रेडशीट एक्सपोर्ट को JSON में बदलें
कैरेक्टर काउंटर
प्लेटफ़ॉर्म सीमाओं के हिसाब से कैरेक्टर गिनें
डिफ़ चेकर
दो टेक्स्ट की तुलना करें और हर फ़र्क़ हाइलाइट करें
Lorem Ipsum जेनरेटर
पैराग्राफ़, वाक्य या शब्दों में फ़िलर टेक्स्ट