PDF से पाठ

PDF से कॉपी करने पर आधे कटे शब्द, स्तंभ के किनारे टूटी पंक्तियाँ और हर चालीस पंक्ति पर दोहराता कंपनी का नाम साथ आते हैं। यहाँ पाठ निकालकर साफ़ किया जाता है — हर सुधार वह स्विच है जिसे आप ख़ुद चालू करते हैं, और फ़ाइल इस टैब से बाहर नहीं जाती।

या यहाँ छोड़ें

पाठ-परत वाला PDF — स्कैन नहीं। 60 MB तक

फ़ाइल इसी उपकरण पर रहती है: टैब के भीतर खुलती है, कुछ भी अपलोड नहीं होता। कुछ डाउनलोड भी नहीं होता — PDF पाठक इसी पन्ने का हिस्सा है।

जो साथ नहीं आता: तस्वीरें, तालिकाएँ तालिका के रूप में, मोटा और तिरछा। तालिका पाठ की पंक्तियाँ बन जाती है, और दो-स्तंभी सजावट पहले बाएँ स्तंभ से पढ़ी जाती है — फ़ाइल में पाठ इसी क्रम में रखा होता है।

पास ही: PDF से Word · तस्वीर से लिखावट · दो PDF मिलाएँ · शब्द गणक

कैसे इस्तेमाल करें

  1. पाठ-परत वाला PDF चुनें — स्कैन नहीं।
  2. जो चाहिए वह चालू करें: हाइफ़न से टूटे शब्द जोड़ें, पंक्तियों को अनुच्छेद में जोड़ें, शीर्षिकाएँ और पृष्ठ संख्याएँ हटाएँ।
  3. पाठ कॉपी करें या .txt फ़ाइल के रूप में डाउनलोड करें।

जानने योग्य बातें

पाठ निकालना आधा काम है

PDF पंक्तियाँ नहीं रखता, वह निर्देशांक सहित पाठ के टुकड़े रखता है। वाक्य के बीच फ़ॉन्ट बदल जाए तो एक पंक्ति दर्जन भर टुकड़ों में आती है, और सीधा-सादा निष्कर्षक उन्हें एक-एक पंक्ति बनाकर लौटा देता है। इसलिए यहाँ पहले ऊँचाई के आधार पर टुकड़े फिर से पंक्तियों में जोड़े जाते हैं, और उसके बाद ही सफ़ाई होती है। यही जोड़-विधि दो PDF की तुलना वाले औज़ार में भी चलती है: वहाँ अलग होती तो एक ही फ़ाइल अलग अंतर दिखाती।

तीन सुधार, और कोई भी चुपचाप नहीं

हाइफ़न से टूटे शब्द जोड़े जाते हैं — पर तभी जब अगली पंक्ति छोटे अक्षर से शुरू हो, वरना संयुक्त नाम एक ही शब्द में चिपक जाता। पंक्तियाँ अनुच्छेद में जुड़ती हैं — पर शीर्षक, क्रमांकित धाराएँ और सूची की मदें अपनी-अपनी पंक्ति रखती हैं: अनुबंध की धाराओं को एक अनुच्छेद में पिघला देना, अतिरिक्त पंक्ति-विरामों को छोड़ने से बुरा है। शीर्षिकाएँ और पृष्ठ संख्याएँ पन्नों पर दोहराव से हटती हैं, और अकेला अंक तभी पृष्ठ संख्या माना जाता है जब वह कुल पृष्ठों से बड़ा न हो — इसलिए तालिका में «2026» बचा रहता है।

स्कैन को अलग उत्तर मिलता है

अगर PDF स्कैन है तो उसमें पाठ है ही नहीं — पन्ने तस्वीरें हैं। ख़ाली डिब्बा लौटाना ऐसा लगता जैसे औज़ार टूटा हो, न कि ग़लत औज़ार चुना गया हो। इसलिए पन्ना बताता है कि क्या हुआ और पाठ-पहचान की ओर भेजता है, जो PDF के पन्ने भी पढ़ती है। जाँच जान-बूझकर मोटी रखी है: पूरे दस्तावेज़ में चालीस अक्षर से कम का मतलब है तस्वीरों के भीतर के शीर्षक, पाठ-परत नहीं।

अक्सर पूछे जाने वाले सवाल

क्या मेरा दस्तावेज़ कहीं अपलोड होता है?

नहीं। वह इसी ब्राउज़र टैब में खुलता है और वहीं पढ़ा जाता है। कुछ डाउनलोड भी नहीं होता — PDF पाठक इसी पन्ने का हिस्सा है।

मेरी फ़ाइल का पाठ ख़ाली क्यों आया?

संभवतः वह स्कैन है: हर पन्ना तस्वीर, पाठ-परत नदारद। उसे «तस्वीर से पाठ» से गुज़ारें — वह अक्षर पहचानता है और PDF के पन्ने भी लेता है।

स्तंभ आपस में क्यों मिल गए?

क्योंकि दो-स्तंभी सजावट उसी क्रम में सहेजी जाती है जिस क्रम में बनी थी, और बायाँ स्तंभ आमतौर पर पूरा पहले आता है। यहाँ क्रम फ़ाइल का अनुसरण करता है, सजावट का अनुमान नहीं लगाता: ग़लत अनुमान स्तंभों से कहीं ज़्यादा गड़बड़ करता है।

तालिकाओं का क्या होता है?

तालिका पाठ की पंक्तियाँ बन जाती है: कोशिकाओं का क्रम रहता है, पर जाल चला जाता है। जाल चाहिए तो «PDF से Excel» लें — वहाँ स्तंभ निर्देशांक से निकाले जाते हैं।

कितना बड़ा दस्तावेज़ चलेगा?

60 MB तक और पहले 500 पृष्ठ। उससे आगे प्रतीक्षा सार्थक नहीं रहती, और पन्ना जमने के बजाय यह बात कह देता है।

संबंधित टूल