सैंपल रेट अपने आधे तक की आवृत्तियाँ पकड़ता है, Nyquist सीमा, इसलिए 44.1 kHz 22.05 kHz तक पहुँचता है, इंसानी सुनने की ऊपरी हद से आराम से ऊपर। 96 kHz तक दोगुना करने से स्टोरेज दोगुना होता है और ऐसी गुंजाइश मिलती है जिसे कोई सीधे सुन नहीं सकता। बिना कंप्रेशन का बिटरेट है सैंपल रेट × बिट डेप्थ × चैनल, इसलिए 48 kHz, 24-बिट स्टीरियो 2,304 kbps है और उसका एक घंटा लगभग एक गीगाबाइट।
इससे ऊँचे रेट बेकार नहीं हो जाते। इससे उनका फ़ायदा अप्रत्यक्ष हो जाता है, और उसे मानकर चलने के बजाय सटीक बताना ज़रूरी।
हिसाब क्या कहता है?
बिना कंप्रेशन का आकार है सैंपल रेट × बिट डेप्थ × चैनल × सेकंड ÷ 8। आँकड़े मेगाबाइट को 10,48,576 बाइट गिनते हैं, कैलकुलेटर की तरह।
| फ़ॉर्मैट | बिटरेट | एक घंटा |
|---|---|---|
| 44.1 kHz, 16-बिट, स्टीरियो | 1,411 kbps | ~605 MB |
| 44.1 kHz, 24-बिट, स्टीरियो | 2,117 kbps | ~908 MB |
| 48 kHz, 24-बिट, स्टीरियो | 2,304 kbps | ~988 MB |
| 96 kHz, 24-बिट, स्टीरियो | 4,608 kbps | ~1.93 GB |
| 320 kbps कंप्रेस्ड | 320 kbps | ~137 MB |
स्टोरेज तीनों कारकों के साथ सीधे अनुपात में बढ़ता है, जिससे फ़ैसले पर सोचना आसान है और बिना ध्यान दिए चार गुना ग़लत हो जाना भी आसान।
ऊँचे रेट का असली तर्क क्या है?
फ़िल्टर की गुंजाइश। कन्वर्टर को सैंपल रेट के आधे से नीचे एक एंटी-एलियासिंग फ़िल्टर चाहिए, और वह फ़िल्टर अनंत रूप से खड़ा नहीं हो सकता, इसलिए 44.1 kHz पर उसे लगभग 20 और 22 kHz के बीच की पतली पट्टी में अपना काम करना पड़ता है।
ऊँचा रेट उस फ़िल्टर को सुनाई देने वाली रेंज से बहुत ऊपर ले जाता है, जहाँ उसका फ़ेज़ बर्ताव और लहरें किसी सुनाई देने वाली चीज़ से नहीं टकरातीं। प्रोसेसिंग पर भी यही लागू है: कुछ नॉन-लीनियर प्लगइन Nyquist के ऊपर हार्मोनिक पैदा करते हैं जो एलियासिंग बनकर नीचे मुड़ आते हैं, और ऊँचे रेट पर काम करना उन धब्बों को रास्ते से हटा देता है।
दोनों तर्क प्रोडक्शन की कड़ी के बारे में हैं, दी गई फ़ाइल के बारे में नहीं। इसीलिए पेशेवर परंपरा है ऊँचे पर रिकॉर्ड और मिक्स करना और 44.1 या 48 kHz पर देना।
बिट डेप्थ क्या बदलती है?
डायनामिक रेंज, आवृत्ति नहीं। हर बिट लगभग 6 dB है, इसलिए 16-बिट लगभग 96 dB रेंज देता है और 24-बिट लगभग 144।
तैयार मास्टर के लिए छियानवे डेसिबल काफ़ी से ज़्यादा है। 24-बिट अपनी क़ीमत रिकॉर्डिंग में वसूलता है, जहाँ आप क्लिपिंग से नीचे अच्छी-ख़ासी गुंजाइश छोड़ना चाहते हैं और फिर भी शोर का तल नीचा चाहते हैं: 24 बिट के साथ आप 20 dB धीमा रिकॉर्ड कर सकते हैं और कुछ भी ज़रूरी नहीं खोते।
यह वही सौदा है जो फ़ोटो को कम एक्सपोज़ करके गुंजाइश रखने में है: अतिरिक्त डेप्थ कैप्चर के दौरान बीमा है, डिलीवरी में क्वालिटी नहीं।
चैनलों की गिनती सब कुछ गुणा करती है और सबसे आसानी से भूला जाने वाला कारक है। स्टीरियो जोड़ी मोनो फ़ाइल का दोगुना है; 5.1 मिक्स छह गुना; और एम्बिसोनिक या ऑब्जेक्ट-आधारित सेशन दर्जनों चैनल का हो सकता है, जहाँ स्टोरेज का हिसाब बाद की बात न रहकर प्रोजेक्ट की सेटिंग तय करने लगता है।
प्रोजेक्ट को कौन-सा रेट इस्तेमाल करना चाहिए?
मंज़िल वाला, और उसी पर टिके रहें। वीडियो लगभग हर जगह 48 kHz है; संगीत वितरण 44.1 kHz; दोनों सेशन जिस भी रेट पर चला उससे बदले जाते हैं, और हर बदलाव एक रीसैंपल है।
जिससे बचना है वह है बार-बार रेट बदलना। हर रीसैंपल एक इंटरपोलेशन है, और अच्छा वाला पारदर्शी होता है, पर एक वर्कफ़्लो में चार की कड़ी सामग्री पर कोई मेहरबानी नहीं करती।
कंप्रेशन असल में क्या हटाता है?
वह बारीकी जिसके बारे में एन्कोडर अंदाज़ा लगाता है कि आपको कमी नहीं खलेगी, आवृत्ति से नहीं, एक साइकोअकूस्टिक मॉडल से चुनी हुई। तेज़ आवाज़ें आवृत्ति और समय में पास की धीमी आवाज़ों को ढक लेती हैं, और लॉसी कोडेक अपने बिट उस पर ख़र्च करता है जो उस ढकने को गिनने के बाद भी सुनाई देता है।
इसीलिए एक ही बिटरेट अलग सामग्री पर बहुत अलग सुनाई देता है। घना मिक्स बहुत कुछ छिपा लेता है; चारों ओर सन्नाटे वाला अकेला वाद्य लगभग कुछ नहीं छिपाता, और वहीं कम बिटरेट के धब्बे सबसे आसानी से सुनाई देते हैं।
लोग जो पूछते हैं
क्या 320 kbps पारदर्शी है? ज़्यादातर सुनने वालों के लिए ज़्यादातर सामग्री पर, हाँ। जो सुनाई देने वाले फ़र्क़ बचते हैं वे ख़ास कठिन सामग्री पर हैं, तालियाँ, झाँझ, कुछ सिंथेसिस, हर जगह नहीं।
क्या ऊँचा सैंपल रेट बास सुधारता है? नहीं। किसी भी आम रेट पर बास Nyquist सीमा के आसपास भी नहीं। कम आवृत्तियों का ठीक से बजना मॉनिटर और कमरे की समस्या है, सैंपलिंग की नहीं।
Nyquist ठीक-ठीक क्या है? वह प्रमेय जिसके अनुसार सैंपल रेट के आधे से नीचे तक सीमित बैंड वाला सिग्नल अपने सैंपल से ठीक-ठीक दोबारा बनाया जा सकता है। व्यावहारिक शर्त «सीमित बैंड» में है: सीमा के ऊपर का सब सैंपलिंग से पहले फ़िल्टर करना होता है, बाद में नहीं।
44 क्यों नहीं, 44.1 क्यों? यह CD के शुरुआती विकास में डिजिटल ऑडियो को वीडियो टेप पर रखने से निकला, जहाँ उपलब्ध लाइन और फ़्रेम रेट से ठीक यही आँकड़ा बना। यह 1970 के दशक के हार्डवेयर का अवशेष है जो उस हार्डवेयर से आधी सदी ज़्यादा जी गया।
क्या पुरानी रिकॉर्डिंग को अपसैंपल करूँ? जो कैप्चर नहीं हुआ वह नहीं मिलता। अपसैंपल करना बाद के किसी प्रोसेसिंग चरण का बर्ताव बेहतर कर सकता है, पर वह बैंडविड्थ वापस नहीं ला सकता जो मूल में कभी थी ही नहीं।
क्या डिदरिंग मायने रखती है? बिट डेप्थ घटाते समय, हाँ। 24 बिट को 16 में काटने से ऐसी सहसंबंधित क्वांटाइज़ेशन त्रुटि बनती है जो उस शोर से बुरी सुनाई देती है जिससे डिदर उसे बदलता है, इसीलिए यह मास्टर का आख़िरी क़दम है, कोई विकल्प नहीं।
रेट बैंडविड्थ तय करता है, डेप्थ डायनामिक रेंज, और दोनों में से कोई वजह नहीं कि रिकॉर्डिंग अच्छी सुनाई दे। दोनों हिसाब एक ही पेज से निकलते हैं: फ़ाइल साइज़ कैलकुलेटर एक रेट, एक डेप्थ और चैनलों की गिनती लेता है, बिना कंप्रेशन का बिटरेट देता है, और उसे प्रति मिनट और प्रति घंटे मेगाबाइट में बदलता है। Nyquist सीमा आप मन में निकाल सकते हैं: वह रेट का आधा है।