PDF कंप्रेस करें
आपकी फ़ाइल इस डिवाइस से बाहर नहीं जाती
बड़ी PDF का ज़्यादातर वज़न इमेज होती हैं। यह हर अंदर लगी JPEG को खोलता है, लक्ष्य से बड़ी हो तो छोटा करता है, आपकी चुनी क्वालिटी पर दोबारा बनाता है, फिर फ़ाइल को ऑब्जेक्ट स्ट्रीम के साथ और दस्तावेज़ की जानकारी वाले ख़ाने साफ़ करके दोबारा लिखता है। स्कैन किए दस्तावेज़ आम तौर पर आधे या उससे भी छोटे हो जाते हैं; सिर्फ़ टेक्स्ट वाली PDF कुछ प्रतिशत बचाती है। कई फ़ाइलें एक साथ छोड़िए और नतीजे एक ZIP में लौटते हैं।
PDF कैसे कंप्रेस करें
यह ठीक-ठीक क्या करता है, यह जानना ही बताता है कि यह मदद करेगा या नहीं। यह दस्तावेज़ में अंदर लगी इमेज ढूँढता है और सिर्फ़ एक तरह की इमेज दोबारा बनाता है: सामान्य JPEG डेटा, सामान्य रंग या सामान्य ग्रेस्केल में, बिना किसी ख़ास डिकोड सेटिंग के। हर एक खोली जाती है, सबसे लंबी भुजा लक्ष्य से बड़ी हो तो छोटी की जाती है, चुनी क्वालिटी पर दोबारा बनाई जाती है, और तभी वापस रखी जाती है जब नतीजा सच में छोटा हो। फिर पूरी फ़ाइल ऑब्जेक्ट स्ट्रीम के साथ, और शीर्षक, लेखक, विषय, कीवर्ड, प्रोड्यूसर और क्रिएटर के ख़ाने साफ़ करके, दोबारा लिखी जाती है।
बाक़ी सब ठीक वैसा ही रहता है। वेक्टर चित्र, फ़ॉन्ट, फ़ॉर्म के ख़ाने और टेक्स्ट को छुआ नहीं जाता। किसी और तरीक़े से रखी इमेज को भी नहीं, और यह समूह लोगों के अंदाज़े से बड़ा है: PDF के अंदर PNG जैसी बिना-नुक़सान वाली इमेज, JPEG 2000 इमेज, CMYK रंग वाली इमेज, और फ़ैक्स जैसी दो-रंग वाली एनकोडिंग जो बहुत से डॉक्यूमेंट स्कैनर काले-सफ़ेद पेज के लिए बनाते हैं। पूरी तरह इन्हीं से बनी PDF सिर्फ़ ढाँचे वाली बचत के साथ लौटेगी।
इसलिए "कुछ क्यों नहीं हुआ" का जवाब लगभग हमेशा एक ही होता है। टेक्स्ट से भरी रिपोर्ट पहले से कुशलता से कंप्रेस है और काम करने को कोई इमेज डेटा नहीं। ग्रेस्केल स्कैन आधा मामला है: उसे दोबारा बनाना रंगीन कैनवस से होकर जाता है, इसलिए नई इमेज अक्सर मूल से छोटी नहीं होती और वहीं छोड़ दी जाती है। जब आउटपुट इनपुट से बड़ा होता, तो पूरी फ़ाइल देने के बजाय ठुकरा दी जाती है, क्योंकि "कंप्रेस्ड" लिखी बड़ी फ़ाइल थमाना यह कहने से बुरा है कि कुछ नहीं हो सका।
जो यह जानबूझकर नहीं करता, वह उन चीज़ों की सूची है जो डेस्कटॉप टूल बिना बताए जानकारी खोकर करते हैं: यह टेक्स्ट को OCR से दोबारा नहीं गुज़ारता, फ़ॉन्ट नहीं काटता या हटाता, फ़ॉर्म के ख़ाने सपाट नहीं करता, वेक्टर चित्रों को बिटमैप नहीं बनाता, और लेयर नहीं फेंकता। इनमें से हर एक जगह बचाता है और हर एक वह चीज़ फेंक सकता है जो आपको चाहिए थी।
एक दुष्प्रभाव निजता का फ़ायदा लगता है और आधा ही है। जो साफ़ होता है वह दस्तावेज़ की जानकारी वाली डिक्शनरी है, वे छह ख़ाने जो रीडर Properties में दिखाता है, लेखक और प्रोड्यूसर समेत। वर्ड प्रोसेसर, लेआउट सॉफ़्टवेयर या Acrobat से लिखी ज़्यादातर PDF में यही जानकारी दूसरी बार XMP मेटाडेटा पैकेट में होती है, और वह पैकेट जैसा था वैसा रहता है। Properties ख़ाली दिख सकती है जबकि नाम फ़ाइल के बाइट में बैठा रहता है। इसे सफ़ाई समझिए, नाम छिपाना नहीं।
पोर्टल की साइज़ सीमा
भारत में PDF कंप्रेस करने की सबसे आम वजह कोई ऑनलाइन आवेदन है: परीक्षा, नौकरी, कॉलेज दाख़िले या किसी सरकारी योजना का पोर्टल, जो हर दस्तावेज़ पर KB या MB की सीमा रखता है। फ़ोन से स्कैन किया गया सर्टिफ़िकेट या मार्कशीट अक्सर उस सीमा से कहीं ऊपर होती है, और क्योंकि वह लगभग पूरी JPEG इमेज होती है, यह ठीक वही मामला है जहाँ यह टूल सबसे ज़्यादा बचाता है। सीमा बहुत कम हो तो क्वालिटी 50 के आसपास और सबसे लंबी भुजा 1200 तक लाइए; A4 का टेक्स्ट फिर भी पढ़ा जा सकता है।
लोग इसे किस काम में लेते हैं
- स्कैन को ईमेल अटैचमेंट की सीमा में लाना
- परीक्षा, नौकरी या सरकारी पोर्टल की साइज़ सीमा पूरी करना
- फ़ोन से स्कैन किए अनुबंध को आगे भेजने से पहले छोटा करना
- फ़ोटो भरी रिपोर्ट को धीमे कनेक्शन के लिए हल्का करना
- दस्तावेज़ किसी वेब सेवा को सौंपे बिना फ़ाइल छोटी करना
- रीडर की Properties में दिखने वाले लेखक और प्रोड्यूसर ख़ाने साफ़ करना
सवाल
क्योंकि वह ज़्यादातर टेक्स्ट और वेक्टर है, जो पहले से कुशलता से कंप्रेस होते हैं। दोबारा बनाने लायक़ इमेज डेटा न हो तो सिर्फ़ ढाँचे की कुछ प्रतिशत बचत बचती है।
सामान्य रंग या सामान्य ग्रेस्केल में सामान्य JPEG डेटा। फ़ाइल की बाक़ी हर चीज़ वैसी ही छोड़ दी जाती है।
बहुत से डॉक्यूमेंट स्कैनर काले-सफ़ेद पेज JPEG के बजाय फ़ैक्स जैसी दो-रंग वाली एनकोडिंग में रखते हैं। वह पहले से बहुत छोटी होती है और यहाँ छुई नहीं जाती।
छोड़ दी जाती हैं। ब्राउज़र कैनवस से उन्हें दोबारा बनाना उन्हें स्क्रीन के रंगों में बदल देता और दस्तावेज़ का प्रिंट बदल जाता, और यह चुपचाप करने लायक़ सौदा नहीं।
दोबारा बनाना रंगीन कैनवस से होकर जाता है, इसलिए नई इमेज अक्सर ग्रेस्केल मूल से छोटी नहीं होती। ऐसा होने पर मूल ही रखा जाता है।
70 की क्वालिटी और सबसे लंबी भुजा पर 1600 पिक्सेल पर स्कैन किया पेज स्क्रीन पर और सामान्य आकार के प्रिंट में पढ़ने लायक़ रहता है। संग्रह वाली क्वालिटी चाहिए तो दोनों स्लाइडर बढ़ाइए।
क्वालिटी 50 के आसपास और सबसे लंबी भुजा 1200 के आसपास लाइए। एक-दो पेज का स्कैन आम तौर पर इसमें आ जाता है; कई पेज हों तो ग़ैरज़रूरी पेज पहले PDF अलग करने वाले टूल से हटाइए।
क्वालिटी 30 से 95 तक, और सबसे लंबी भुजा 600 से 3000 पिक्सेल तक। किसी को भी बदलने से पूरा बैच दोबारा चलता है।
क्वालिटी 85 और सबसे लंबी भुजा कम से कम 2400, जो A4 पेज पर लगभग 205 dpi है। डिफ़ॉल्ट 1600 लगभग 137 dpi बैठता है, स्क्रीन पर ठीक और काग़ज़ पर साफ़ नरम।
हाँ। जितनी चाहें छोड़िए। वे एक के बाद एक प्रोसेस होती हैं और एक ZIP में लौटती हैं, क्योंकि ब्राउज़र लगातार कई अलग डाउनलोड रोक देते हैं।
छोड़ दिया जाता है और फ़ाइल को पहले से लगभग जितनी छोटी हो सकती है उतनी बताया जाता है। उस हालत में आपकी मूल फ़ाइल ही बेहतर है।
नहीं। टेक्स्ट, फ़ॉन्ट, वेक्टर चित्र, फ़ॉर्म के ख़ाने और पेज की बनावट को छुआ नहीं जाता। सिर्फ़ इमेज डेटा और फ़ाइल का ढाँचा बदलता है।
दस्तावेज़ की जानकारी वाली डिक्शनरी के छह ख़ाने: शीर्षक, लेखक, विषय, कीवर्ड, प्रोड्यूसर और क्रिएटर। किसी पेज पर दिखने वाला कुछ नहीं हटता।
नहीं। सिर्फ़ जानकारी वाली डिक्शनरी साफ़ होती है। वर्ड प्रोसेसर या लेआउट सॉफ़्टवेयर से लिखी PDF में वही जानकारी आम तौर पर XMP पैकेट में दूसरी बार होती है, जिसे छुआ नहीं जाता।
फ़ाइल दोबारा लिखने से कोई भी मौजूदा हस्ताक्षर अमान्य हो जाता है, जैसे बाइट बदलने वाले किसी भी टूल से। कंप्रेस करने के बाद हस्ताक्षर कीजिए, पहले नहीं।
नहीं। एन्क्रिप्टेड PDF पहले खोलनी होगी, और यह सिर्फ़ आप कर सकते हैं।
PDF पढ़ने वाली लाइब्रेरी पहली बार फ़ाइल चुनने पर डाउनलोड होती है। यह लगभग 175 KB है, पूरे बैच के लिए एक बार आती है, और फिर कैश में रहती है।
वह पूरे दस्तावेज़ को तस्वीर बना देता है, यानी टेक्स्ट टेक्स्ट न रहकर टेक्स्ट की तस्वीर बन जाता है। फ़ाइल छोटी होती है पर उसमें न खोज हो सकती है न चुनाव।
इसकी सीमा मेमोरी है, कोई तय संख्या नहीं, क्योंकि दोबारा लिखते समय पूरा दस्तावेज़ ब्राउज़र में रहता है। फ़ोन, लैपटॉप से बहुत पहले जवाब दे देता है।
नहीं। सब कुछ इसी पेज में होता है। फ़ाइल चुनने पर लाइब्रेरी आपके ब्राउज़र में आती है; फ़ाइल कहीं नहीं जाती।