PDF से Word बनने पर क्या बचता है और क्या मिट जाता है
आपने PDF को Word में बदला और तालिका टेढ़ी निकली। आपको लगा औज़ार ख़राब है, दूसरा आज़माया, नतीजा क़रीब-क़रीब वही रहा। कुछ समस्याएँ औज़ार बदलने से नहीं जातीं।
PDF छोड़िए और उसके भीतर का लेख Word फ़ाइल में अनुच्छेद और तालिका के रूप में फिर से बन जाता है। कुछ भी पन्ने की तस्वीर की तरह नहीं चिपकाया जाता, इसलिए जो आप उतारते हैं वह तुरंत संपादित होने वाला दस्तावेज़ है।
कोई अपलोड नहीं
बदलने वाली PDF
PDF में असली टेक्स्ट होना चाहिए। स्कैन की गई PDF पन्ने की तस्वीर होती है, इसलिए उसमें से निकालने को कोई टेक्स्ट नहीं होता। फ़ाइलें इसी ब्राउज़र में खुलती हैं और कभी अपलोड नहीं होतीं।
पढ़ने का क्रम, अनुच्छेद और तालिकाएँ आ जाती हैं। पन्ने पर सटीक जगह नहीं आती। PDF कभी दर्ज नहीं करती कि क्या अनुच्छेद था और क्या तालिका, इसलिए दोनों अक्षरों की जगह देखकर दोबारा बनाए जाते हैं।
पन्ने पर छपी तस्वीरें, मुहरें और हस्ताक्षर भी निकालकर दस्तावेज़ में रखे जाते हैं। वे अपनी मूल जगह पर नहीं, पढ़ने के क्रम में आते हैं।
स्कैन की गई PDF में टेक्स्ट नहीं, तस्वीरें होती हैं, इसलिए बदलने को कुछ नहीं होता। फ़ाइल डालकर देखिए, टूल तुरंत बता देगा।
पूरे पन्ने तस्वीर बनाकर नहीं चिपकाए जाते। डाउनलोड की गई फ़ाइल Word या Excel में बदलने लायक दस्तावेज़ के रूप में खुलती है।
फ़ाइल में असली लेख होना चाहिए। एक साथ कई भी चलेंगी।
हर पन्ने को पढ़कर देखा जाता है कि अक्षर कहाँ बैठे हैं, फिर उन्हें अनुच्छेद और तालिका में बाँटा जाता है। प्रगति पन्ने की संख्या से दिखती है।
यह Word में संपादन के लिए तैयार खुलती है। आपका मूल PDF अछूता रहता है।
PDF लेख रखने का नहीं, पन्ना बनाने का प्रारूप है। फ़ाइल के भीतर बस निर्देशों की एक लंबी सूची होती है कि यह अक्षर यहाँ छापो, और कहीं दर्ज नहीं होता कि अनुच्छेद कहाँ ख़त्म हुआ था या अंकों का कौन सा गुच्छा तालिका था। दस्तावेज़ को PDF में निर्यात करते ही वह जानकारी फेंक दी जाती है।
इसलिए यह रूपांतरण नहीं, पुनर्निर्माण है। अक्षर कहाँ बैठे हैं, पंक्तियों के बीच कितनी दूरी है और टाइप कितना बड़ा है, इन्हें पढ़कर मूल आकार का अनुमान लगाया जाता है। सामान्य से चौड़ा अंतर, या दाहिने हाशिये से काफ़ी पहले रुक गई पंक्ति, बताती है कि अनुच्छेद वहीं ख़त्म हुआ। कई पंक्तियों में जिन कोष्ठों का बायाँ किनारा एक ही जगह खड़ा हो, वह तालिका है।
अनुमान है तो ग़लत भी हो सकता है। जो यह नहीं करेगा वह है न मिली हुई जानकारी गढ़ना। बिना लेख वाले पन्ने को ख़ाली बताया जाता है, और तैयार दस्तावेज़ को आपके पास पहुँचने से पहले दोबारा पढ़कर जाँचा जाता है।
पढ़ने का क्रम, अनुच्छेद, शीर्षक और तालिकाएँ साथ आती हैं, पन्ना बदलना भी। पन्ने पर पड़े चित्र, मुहर और हस्ताक्षर भी निकालकर रखे जाते हैं, बस उनकी जगह मूल निर्देशांक नहीं बल्कि पढ़ने का क्रम तय करता है। जो नहीं आता वह है पन्ने पर की सटीक सजावट, फ़ॉन्ट और अक्षरों का रंग।
सजावट की नक़ल जान-बूझकर नहीं की जाती। जगह को हूबहू उतारने का मतलब है तय निर्देशांकों पर ढेर सारे टेक्स्ट बॉक्स बिखेरना, और ऐसा बना दस्तावेज़ खुलता तो है पर एक पंक्ति बदलते ही ढह जाता है। इस औज़ार का मक़सद वह दस्तावेज़ है जिसमें आप काम कर सकें।
| मद | साथ आता है? |
|---|---|
| पढ़ने का क्रम और शब्द | हाँ |
| अनुच्छेद का विभाजन | जगह देखकर फिर से बनाया जाता है |
| शीर्षक | मुख्य लेख से बड़ा टाइप शीर्षक माना जाता है |
| तालिकाएँ | पंक्तिबद्ध जानकारी से फिर से बनाई जाती हैं |
| पन्ना बदलना | हाँ |
| फ़ॉन्ट, रंग, सटीक सजावट | नहीं |
| चित्र, मुहर, हस्ताक्षर | हाँ, पढ़ने के क्रम में रखे जाते हैं |
काग़ज़ की तस्वीर खींचकर या दफ़्तर के स्कैनर से बनाया गया PDF हर पन्ने के लिए एक तस्वीर भर है। आपकी आँखों को अक्षर दिखते हैं, पर फ़ाइल में एक भी नहीं होता। निकालने को कुछ नहीं, तो बनाने को भी कुछ नहीं।
यह औज़ार आपको ख़ाली फ़ाइल थमाने के बजाय साफ़ कह देता है। अगर सिर्फ़ कुछ पन्ने स्कैन हैं, तो वह बता देता है कि कौन से पन्ने ख़ाली लौटे। तस्वीरों में से अक्षर पढ़ना यह औज़ार नहीं करता।
पूरा रूपांतरण इसी ब्राउज़र के भीतर होता है। PDF पढ़ना और नया दस्तावेज़ लिखना, दोनों आपके उपकरण पर चल रहे कोड का काम है। अपलोड नाम का कोई क़दम है ही नहीं।
आप ख़ुद जाँच सकते हैं। डेवलपर टूल (F12) का नेटवर्क टैब खोलकर रूपांतरण चलाइए: आपकी फ़ाइल जितना बड़ा कोई अपलोड अनुरोध या तो दिखेगा या नहीं दिखेगा।
नहीं। PDF पढ़ना और Word फ़ाइल लिखना, दोनों इसी ब्राउज़र के भीतर होते हैं। न कोई खाता चाहिए, न कुछ इंस्टॉल करना।
नहीं। शब्द, पढ़ने का क्रम, अनुच्छेद और तालिकाएँ साथ आती हैं, पर पन्ने पर की सजावट दोहराई नहीं जाती। उसकी नक़ल का मतलब है टेक्स्ट बॉक्स को निर्देशांकों पर टाँकना, और ऐसा दस्तावेज़ संपादित नहीं हो सकता।
PDF की तालिकाओं में अक्सर लकीरें होती ही नहीं, और जहाँ होती हैं वे किसी और परत पर खिंची होती हैं जिसे लेख निकालना कभी नहीं देखता। इसलिए तालिका इस आधार पर खोजी जाती है कि कोष्ठ नीचे तक एक सीध में हैं या नहीं। सँकरे स्तंभ और जुड़े हुए कोष्ठ इसे बिगाड़ सकते हैं।
नहीं। स्कैन पन्ने की तस्वीर है और उसमें एक भी अक्षर नहीं होता। एक डालकर देखिए, औज़ार तुरंत बता देगा।
अगर पासवर्ड पता है तो चलेगा। एन्क्रिप्टेड फ़ाइल मिलने पर पासवर्ड का ख़ाना दिखता है। भरकर दोबारा चलाइए।
कोई सीमा नहीं रखी गई। पर सब कुछ आपके उपकरण पर चलता है, इसलिए बहुत लंबा दस्तावेज़ उसी हिसाब से समय लेता है। कंप्यूटर फ़ोन से तेज़ है।
आपने PDF को Word में बदला और तालिका टेढ़ी निकली। आपको लगा औज़ार ख़राब है, दूसरा आज़माया, नतीजा क़रीब-क़रीब वही रहा। कुछ समस्याएँ औज़ार बदलने से नहीं जातीं।
दो हालात: आपके पास .docx है और Word नहीं, या Word फ़ाइल को "Word found unreadable content" कहकर लौटा देता है। नीचे वे मुफ़्त प्रोग्राम हैं जो इसे खोलते हैं, हर एक आपसे क्या माँगता है, और जिस फ़ाइल को इनमें से कोई न खोले उससे टेक्स्ट कैसे निकालें।
अनुबंध में बस एक तारीख़ बदलनी है। Word में बदलिए तो सारणियाँ और हाशिये खिसक जाते हैं, और वापस PDF बनाइए तो फ़ॉन्ट भी बदल जाता है। एक पंक्ति के लिए पूरा दस्तावेज़ दूसरा हो जाता है।