PDF में लिखाई पहचानें

स्कैन किया अनुबंध, फ़ोन से खींचा पन्ना, PDF में सहेजा पुराना फ़ैक्स — देखने में दस्तावेज़, बर्ताव में तस्वीर: न खोज चलती है, न एक पंक्ति कॉपी होती है, और स्क्रीन रीडर के पास पढ़ने को कुछ नहीं। यह पन्ना शब्दों को पहचानकर ठीक उन्हीं जगहों पर लौटा देता है जहाँ वे काग़ज़ पर हैं — बस दिखते नहीं। स्कैन वैसा ही दिखता है, बाक़ी सब काम करने लगता है।

पहचान पढ़ना नहीं, अनुमान है: साफ़ छपा पन्ना क़रीब-क़रीब सही आता है, मुड़े हुए रसीद की फ़ोटो नहीं। कुछ भी अपने आप ठीक नहीं किया जाता — संख्या में «सही-सा» सुधार वह ग़लती है जो आप कभी पकड़ नहीं पाएँगे।

स्कैन अपलोड नहीं होता: इंजन और भाषा का मॉडल आपके ब्राउज़र में उतरते हैं और वहीं काम करते हैं। नतीजा आपका ही स्कैन है, ऊपर एक अदृश्य लिखाई की परत के साथ — तस्वीर वही रहती है, पर खोज, कॉपी और स्क्रीन रीडर काम करने लगते हैं।

आस-पास: तस्वीर से लिखावट · PDF से पाठ · PDF से Word · PDF कंप्रेस करें

कैसे इस्तेमाल करें

  1. स्कैन किया PDF चुनिए।
  2. दस्तावेज़ की भाषा चुनिए — पहचान इसी पर सबसे ज़्यादा निर्भर करती है।
  3. बटन दबाइए, प्रतीक्षा कीजिए, और खोजने लायक़ PDF या सादा टेक्स्ट डाउनलोड कीजिए।

जानने योग्य बातें

खोजने लायक़ PDF असल में क्या है

यह आपका ही स्कैन है, दूसरी परत के साथ: पहचाने गए शब्द, छपे शब्दों के ठीक ऊपर, अदृश्य स्याही से लिखे हुए। पन्ना बिलकुल वैसा दिखता है — वही काग़ज़, वही मुहरें, हाशिये पर वही टिप्पणी — पर Ctrl+F उसमें नाम ढूँढ़ लेता है, वाक्य कॉपी होता है और स्क्रीन रीडर पढ़ देता है। इसीलिए तस्वीर रखी जाती है, साफ़ पाठ से बदली नहीं जाती: स्कैन अक्सर ख़ुद ही दस्तावेज़ होता है, और उसे दोबारा सजाना उसे कुछ और बना देगा।

पहचान पढ़ना नहीं, अनुमान है

साफ़ छपा पन्ना क़रीब-क़रीब सही आता है। मुड़ी हुई रसीद की फ़ोटो नहीं, और कोई इंजन इसे बदल नहीं सकता। इसलिए काम के बाद औसत भरोसा दिखाया जाता है, और कुछ भी अपने आप नहीं सुधारा जाता: अंक में «सही-सा» सुधार वही ग़लती है जिसे कोई पकड़ नहीं पाता। भरोसा करने से पहले पढ़ लीजिए — ख़ासकर संख्याएँ।

अक्सर पूछे जाने वाले सवाल

क्या मेरा स्कैन अपलोड होता है?

नहीं। इंजन और भाषा का मॉडल आपके ब्राउज़र में उतरते हैं और वहीं चलते हैं; फ़ाइल डिवाइस पर रहती है।

कुल कितना डाउनलोड होगा?

लगभग दो-तीन मेगाबाइट: इंजन और एक भाषा मॉडल। संख्या दबाने से पहले पन्ने पर लिखी होती है, और पहली बार के बाद सब बिना नेटवर्क चलता है।

मेरी PDF में पहले से टेक्स्ट है — क्या फिर भी चलाऊँ?

नहीं, और पन्ना यह देखते ही बता देता है: पहचान अच्छे पाठ को अनुमान से बदल देगी। «PDF से टेक्स्ट» लीजिए।

कितने पन्ने संभालेगा?

पचास तक। उससे ज़्यादा में ब्राउज़र दसियों मिनट लगाएगा, और पन्ना बता देता है कि कितने हुए।

संबंधित टूल