बड़ी PDF का लगभग सारा वज़न तस्वीरों का होता है। स्कैन किया हुआ दस्तावेज़ असल में तस्वीरों का ढेर है और ख़ूब छोटा होता है; वर्ड प्रोसेसर से बनी रिपोर्ट टेक्स्ट, वेक्टर और फ़ॉन्ट का डेटा है, और उसमें हटाने को बहुत कम होता है। अगर 3 MB की PDF कंप्रेस करने पर मुश्किल से बदलती है, तो वह पहले से लगभग उतनी ही छोटी थी जितनी उसकी सामग्री इजाज़त देती है।
आपके पास किस तरह की फ़ाइल है, यह एक नज़र में पता चल जाता है, और कुछ भी आज़माने से पहले नतीजा बता देता है।
आपकी PDF किस तरह की है?
दो परिवार, जो बिल्कुल अलग बर्ताव करते हैं।
| प्रकार | कैसे पहचानें | आम बचत |
|---|---|---|
| स्कैन की हुई | टेक्स्ट सेलेक्ट नहीं होता; ज़ूम पर पिक्सेल दिखते हैं | आधी या उससे ज़्यादा |
| टेक्स्ट वाली | टेक्स्ट साफ़ सेलेक्ट होता है; ज़ूम पर भी तीखा रहता है | कुछ प्रतिशत |
| मिली-जुली | सेलेक्ट होने वाला टेक्स्ट और बड़ी तस्वीरें | बीच में कहीं |
परखने का तरीक़ा ज़ूम है। जो टेक्स्ट 400 प्रतिशत पर भी तीखा रहे वह असली टेक्स्ट है: कुछ किलोबाइट के अक्षर और एक अंदर रखा फ़ॉन्ट। जो टेक्स्ट पिक्सेल के चौकोर टुकड़ों में बदल जाए वह टेक्स्ट की तस्वीर है, और 300 DPI पर एक पेज की तस्वीर कुछ और जोड़ने से पहले ही कई MB की होती है।
ब्राउज़र में कंप्रेशन असल में क्या करता है?
तीन ठोस काम, और उनकी सीमा साफ़ समझ लेना अच्छा है।
- अंदर रखी JPEG तस्वीरों को दोबारा एन्कोड करता है, आपकी चुनी क्वालिटी पर, और बचत यहीं से आती है।
- तस्वीरें छोटी करता है जो लक्ष्य आकार से बड़ी हैं, क्योंकि A4 पेज पर 4000 पिक्सेल चौड़ा स्कैन उससे कहीं ज़्यादा बारीकी है जितनी पेज दिखा सकता है।
- फ़ाइल का ढाँचा दोबारा लिखता है, ऑब्जेक्ट स्ट्रीम के साथ, और मेटाडेटा हटाता है, जिससे थोड़ी-सी स्थिर बचत होती है।
यह क्या नहीं करता: टेक्स्ट पर दोबारा OCR, फ़ॉन्ट की छँटाई या अदला-बदली, फ़ॉर्म फ़ील्ड को चपटा करना, या वेक्टर ड्रॉइंग को पिक्सेल में बदलना। डेस्कटॉप टूल इनमें से कुछ करते हैं, और हर एक में जानकारी खो सकती है: चपटा किया गया फ़ॉर्म फिर भरा नहीं जा सकता, और छाँटा गया फ़ॉन्ट टेक्स्ट निकालना तोड़ सकता है।
इसीलिए पहले से कंप्रेस की हुई PDF को दोबारा कंप्रेस करने से लगभग कुछ नहीं मिलता। एक बार तस्वीरें कम क्वालिटी पर एन्कोड हो गईं, तो दोहराने पर कोई गुंजाइश नहीं बचती और बस नुक़सान का एक दौर और जुड़ता है। जो फ़ाइल एक बार कंप्रेसर से गुज़र चुकी है, उसे दोबारा कंप्रेस करने के बजाय मूल स्रोत से फिर बनाना चाहिए।
फ़ॉन्ट इतनी जगह क्यों लेते हैं?
क्योंकि PDF उन्हें अपने अंदर रख लेती है ताकि दस्तावेज़ हर जगह एक जैसा दिखे, और कई वज़न वाली पूरी फ़ॉन्ट फ़ाइल सैकड़ों किलोबाइट की होती है। दो पेज की चिट्ठी में यह लगभग पूरी फ़ाइल हो सकती है।
फ़ॉन्ट की छँटाई, यानी सिर्फ़ इस्तेमाल हुए अक्षर रखना, इसका आम इलाज है और आम तौर पर PDF बनाने वाला प्रोग्राम ख़ुद करता है। जब यह नहीं हुआ होता, फ़ाइल पूरा टाइपफ़ेस ढोती है, उन अक्षरों समेत जो कभी आते ही नहीं। हिंदी दस्तावेज़ों में यह और ज़्यादा दिखता है, क्योंकि देवनागरी फ़ॉन्ट में संयुक्ताक्षरों की वजह से ग्लिफ़ बहुत ज़्यादा होते हैं, और यह उन गिने-चुने मामलों में से है जहाँ सिर्फ़ टेक्स्ट वाली PDF अप्रत्याशित रूप से बड़ी निकलती है।
जब कुछ भी छोटा न हो, तब क्या काम करता है?
नतीजे के बजाय स्रोत पर काम करना।
- कम रेज़ॉल्यूशन पर दोबारा स्कैन करें। लगभग हर दस्तावेज़ 200 DPI पर पढ़ने लायक़ है, और यह 300 DPI के डेटा का 44 प्रतिशत है।
- ग्रेस्केल या ब्लैक-ऐंड-व्हाइट में स्कैन करें जब रंग कोई जानकारी न देता हो। काले-सफ़ेद पेज का रंगीन स्कैन बिना किसी फ़ायदे के तीन गुना डेटा है।
- PDF बनाने से पहले तस्वीरें छोटी करें, अगर PDF आपने ख़ुद बनाई है।
- दस्तावेज़ को बाँट दें। 4 MB की दो फ़ाइलें अक्सर वहाँ चली जाती हैं जहाँ 8 MB की एक नहीं जाती।
आख़िरी तरीक़ा याद रखने लायक़ है, क्योंकि सीमा आम तौर पर ईमेल, किसी सरकारी पोर्टल या परीक्षा फ़ॉर्म की होती है, डिस्क की जगह की नहीं, और ये सीमाएँ प्रति फ़ाइल लागू होती हैं। कई फ़ॉर्म एक दस्तावेज़ के लिए कुछ सौ KB से 1–2 MB तक ही लेते हैं।
क्या इससे मेरे स्कैन धुँधले हो जाएँगे?
ऊँची क्वालिटी सेटिंग पर, ध्यान देने लायक़ नहीं। दोबारा एन्कोडिंग उन तस्वीरों पर होती है जिनका रेज़ॉल्यूशन अक्सर पेज की ज़रूरत से कहीं ज़्यादा होता है, इसलिए 4000 पिक्सेल के स्कैन को 1600 पर लाकर 70 प्रतिशत क्वालिटी पर एन्कोड करने से आम तौर पर स्क्रीन पर हूबहू वैसा ही दस्तावेज़ मिलता है।
फ़र्क़ बारीक छपाई में दिखता है, और हर उस चीज़ में जिसे आप ज़ूम करेंगे। अगर दस्तावेज़ कोई अनुबंध है जिसे कोई ध्यान से पढ़ेगा, तो मूल सँभालकर रखें और कंप्रेस किया रूप सिर्फ़ वहीं भेजें जहाँ आकार की सीमा मजबूर करे।
लोग जो पूछते हैं
क्या यह पासवर्ड वाली फ़ाइलों पर चलता है? नहीं। एन्क्रिप्ट की गई PDF पासवर्ड के बिना पढ़ी नहीं जा सकती, इसलिए सुरक्षा पहले वही हटाए जिसके पास पासवर्ड है।
क्या मेरा दस्तावेज़ अपलोड होता है? नहीं। फ़ाइल ब्राउज़र में ही पढ़ी और दोबारा लिखी जाती है और डिवाइस से बाहर नहीं जाती, और किसी भी गोपनीय चीज़ के लिए ब्राउज़र वाला टूल चुनने की सबसे बड़ी वजह यही है।
पहली बार यह धीमा क्यों चलता है? क्योंकि PDF पढ़ने वाली लाइब्रेरी पेज खुलने पर नहीं, पहली बार इस्तेमाल होने पर लोड होती है। मौजूदा PDF पढ़ने के लिए सचमुच पूरा पार्सर चाहिए, इसलिए वह फ़ाइल चुनने पर डाउनलोड होता है, उससे पहले नहीं।
अगर टूल कहे कि बचाने को कुछ नहीं है? तो मूल फ़ाइल ही सबसे अच्छी है। मूल जितने ही आकार का कंप्रेस किया रूप बेवजह क्वालिटी खो चुका है, और 2 प्रतिशत छोटी फ़ाइल थमा देने से यह साफ़ कह देना ज़्यादा ईमानदार है।
फ़ाइल के साथ क्या हो सकता है, यह तय करने से पहले देखें कि उसके अंदर क्या है। PDF कंप्रेस करें तस्वीरों से भरे मामले सँभालता है, PNG से PDF शुरू से सही आकार के दस्तावेज़ बनाता है, और इमेज रीसाइज़ करें वह जगह है जहाँ इनपुट ठीक किए जाते हैं।