अक्षर गिनती
कुछ लिखिए, सबसे ज़्यादा आने वाले शब्द यहाँ दिखने लगेंगे।
कुछ लिखिए, सबसे ज़्यादा आने वाले शब्द यहाँ दिखने लगेंगे।
गिनती हर कीस्ट्रोक पर बदलती है, स्पेस के साथ भी और बिना भी, और साथ में वे सीमाएँ भी जिनके लिए लोग आम तौर पर गिनते हैं। यहाँ «अक्षर» का मतलब वही है जो कोई इंसान अक्षर कहेगा — इसलिए «क्ष» एक अक्षर है, तीन नहीं, और कोई इमोजी भी एक ही, चाहे वह कितने भी बाइट ले। कुछ भी कहीं नहीं भेजा जाता; गिनती इसी पेज के अंदर होती है।
अक्षर कैसे गिनें
हिंदी SMS हमेशा 70 अक्षर का होता है
SMS की सीमा गणित है, परंपरा नहीं। छोटे संदेश का मुख्य भाग 140 ऑक्टेट का होता है। GSM का 7-बिट वर्णमाला एक अक्षर को सात बिट में रखती है, और 140 ऑक्टेट यानी 1,120 बिट — इसलिए ठीक 160 अक्षर समाते हैं।
उस वर्णमाला में देवनागरी का एक भी अक्षर नहीं है। नतीजा सीधा है: जिस संदेश में एक भी हिंदी अक्षर हो, वह पूरा संदेश UCS-2 में जाता है, सोलह बिट प्रति अक्षर, और 1,120 ÷ 16 = 70। यह कोई गड़बड़ी नहीं, यही सामान्य स्थिति है। इसीलिए इस पेज की SMS पट्टी 70 पर है और 160 पर नहीं: 160 सिर्फ़ तभी लागू होता है जब पूरा संदेश रोमन लिपि में टाइप किया गया हो। जुड़े हुए संदेशों में जोड़ने वाला हेडर उन्हीं 140 ऑक्टेट के भीतर रहता है, इसलिए हर हिस्सा 67 अक्षर का रह जाता है।
यही वजह है कि हिंदी में भेजा गया वही संदेश, जो रोमन में एक SMS में चला जाता, अक्सर तीन में बँट जाता है।
«क्ष» एक अक्षर है, तीन नहीं
भीतर से कोई स्ट्रिंग कोड यूनिट की शृंखला होती है, और एक दिखने वाला अक्षर उनमें से कई घेर सकता है। «क्ष» दरअसल क + ् + ष है, यानी तीन कोड पॉइंट; «स्त्री» चार; मात्रा लगा हर अक्षर कम से कम दो। यह पेज ब्राउज़र के अपने सेगमेंटर से ग्राफ़ीम क्लस्टर गिनता है, इसलिए इनमें से हर एक एक ही गिना जाता है — ठीक वैसे ही जैसे बैकस्पेस की एक दबाव उसे पूरा मिटा देती है।
कई सर्वर-साइड सिस्टम इसकी जगह UTF-16 यूनिट गिनते हैं और उन्हें वही «क्ष» तीन दिखता है। जब कोई फ़ॉर्म ऐसा बायो ठुकरा दे जिसे यह टूल आराम से छोटा बता रहा हो, तो वजह लगभग हमेशा यही होती है: दोनों सिरे «अक्षर» का मतलब अलग समझ रहे हैं। अंग्रेज़ी पेज पर यही बात इमोजी से समझाई जाती है; हिंदी में यह सजावट का नहीं, सामान्य गद्य का मामला है।
बाक़ी आँकड़े क्या बताते हैं
यहाँ शब्द का मतलब है एक वर्ण या अंक, और उसके बाद वर्णों, अंकों, अपॉस्ट्रॉफ़ी और हाइफ़न की कोई भी लड़ी — इसलिए «आत्म-निर्भर» एक शब्द है और «2026» भी। वाक्य पूर्ण विराम (।), प्रश्नचिह्न, विस्मयादिबोधक या तीन बिंदुओं पर कटते हैं। पढ़ने का समय 238 शब्द प्रति मिनट पर निकाला जाता है, जो ब्रिसबर्ट के 2019 के मेटा-विश्लेषण से मौन पठन का औसत है और अंग्रेज़ी पर नापा गया है; देवनागरी पढ़ने की गति पर तुलनीय आँकड़े कम हैं, इसलिए यह अनुमान है और इसे वैसा ही समझिए। बोलने का समय 130 पर है।
लोग इसे किस काम में लेते हैं
- हिंदी SMS को 70 अक्षरों के भीतर रखना ताकि वह एक ही संदेश में जाए
- यह समझना कि रोमन में एक SMS जाने वाला संदेश हिंदी में तीन क्यों हो गया
- मेटा डिस्क्रिप्शन को उस लंबाई तक काटना जो Google सचमुच दिखाएगा
- फ़ॉर्म के ठुकराने से पहले बायो को उसकी सीमा से मिलाकर देखना
- यह पता लगाना कि छोटा दिखने वाला टेक्स्ट किसी फ़ील्ड में क्यों नहीं जा रहा
- फ़ीड में कटने से पहले कैप्शन की लंबाई नापना
- ड्राफ़्ट में सबसे ज़्यादा दोहराए गए शब्द देखना
सवाल
70। देवनागरी GSM की 7-बिट वर्णमाला में है ही नहीं, इसलिए एक भी हिंदी अक्षर पूरे संदेश को UCS-2 में भेज देता है — सोलह बिट प्रति अक्षर, और 1,120 ÷ 16 = 70। रोमन में टाइप किया वही संदेश 160 तक जाता है।
67। जोड़ने वाला हेडर उन्हीं 140 ऑक्टेट के भीतर रहता है और जगह खाता है, इसलिए हर हिस्सा 70 से घटकर 67 रह जाता है।
यहाँ एक। भीतर से वह क + ् + ष है, यानी तीन कोड पॉइंट, लेकिन एक ही ग्राफ़ीम क्लस्टर — और बैकस्पेस की एक दबाव उसे पूरा मिटाती है। जो सिस्टम UTF-16 यूनिट गिनते हैं उन्हें वही तीन दिखता है।
नहीं। «कि» की मात्रा उसी अक्षर का हिस्सा है, इसलिए «कि» एक अक्षर है, दो नहीं। यही वजह है कि इस पेज की गिनती और किसी डेटाबेस की गिनती अलग निकल सकती है।
दोनों आँकड़े एक साथ स्क्रीन पर हैं। सोशल और SMS की सीमाएँ स्पेस गिनती हैं; कई अकादमिक जमा-कार्यों में स्पेस के बिना गिनने को कहा जाता है, जो आम गद्य में क़रीब छठे हिस्से कम आता है।
आम तौर पर मात्राओं, संयुक्ताक्षरों या इमोजी की वजह से। यह वही गिनता है जिसे आप अक्षर कहेंगे; कई सिस्टम नीचे की UTF-16 यूनिट गिनते हैं।
सामान्य पोस्ट के लिए 280, वज़न के साथ गिने हुए: CJK रेंज के अक्षर एक की जगह दो गिने जाते हैं। देवनागरी एक ही गिनी जाती है। लिंक असली लंबाई चाहे जो हो, शॉर्टनर की तय लंबाई पर गिना जाता है।
यह काम चलाने का आँकड़ा है, नियम नहीं। Google पिक्सेल चौड़ाई पर काटता है और डिस्क्रिप्शन अक्सर ख़ुद दोबारा लिख देता है, इसलिए चौड़े अक्षरों वाली पंक्ति 155 से पहले ही कट जाती है।
एक वर्ण या अंक, और उसके बाद वर्णों, अंकों, अपॉस्ट्रॉफ़ी और हाइफ़न की कोई भी लड़ी। इसलिए «आत्म-निर्भर» एक शब्द है और «2026» भी।
238 शब्द प्रति मिनट से, जो ब्रिसबर्ट के 2019 के मेटा-विश्लेषण में मौन पठन का औसत है। वह अध्ययन अंग्रेज़ी पर है, इसलिए देवनागरी के लिए यह अनुमान है; बोलने का समय 130 पर निकलता है।
सूची «के», «है» जैसे बहुत आम शब्द छोड़ देती है, तीन वर्ण से छोटी हर चीज़ छोड़ देती है, और बचे हुए में से दस सबसे आम दिखाती है।
कोई सीमा तय नहीं की गई है। यह आपके डिवाइस पर चलता है, इसलिए पूरा अध्याय भी ठीक है; सीमा सिर्फ़ आपकी मशीन है।
नहीं। न कोई अपलोड, न कुछ सहेजा जाना; टैब बंद कीजिए और वह चला गया।