मैं अलग हो गया

FIRSTonline बैनर

इंटरनेट पेज गायब हो गए: 10 वर्षों में 38% वेब पेज अब पहुंच योग्य नहीं हैं लेकिन यह कोई आश्चर्य की बात नहीं है

प्यू रिसर्च सेंटर ने यह जांचने के लिए एक विश्लेषण किया कि 10 साल की अवधि में कितनी बार ऑनलाइन सामग्री अनुपलब्ध हो जाती है। अध्ययन से पता चलता है - उदाहरण के लिए - कि 38 में मौजूद 2013% वेब पेज अब 2023 में उपलब्ध नहीं होंगे। अगर हम इंटरनेट के कुछ अजीब पहलुओं पर विचार करें तो यह आंकड़ा चौंकाने वाला नहीं होना चाहिए।

इंटरनेट पेज गायब हो गए: 10 वर्षों में 38% वेब पेज अब पहुंच योग्य नहीं हैं लेकिन यह कोई आश्चर्य की बात नहीं है

38 में मौजूद 2013% वेब पेज निर्माण के दस साल बाद अब पहुंच योग्य नहीं हैं। वह यह कहता है अमेरिकी अनुसंधान केंद्र "प्यू" द्वारा एक अध्ययन, जो सामाजिक समस्याओं, जनमत और जनसांख्यिकीय रुझानों पर जानकारी प्रदान करता है। इस विश्लेषण के परिणाम के अर्थ को पूरी तरह से समझने के लिए, सबसे पहले, यह स्थापित करना आवश्यक है कि "" का क्या अर्थ है।पेज अब पहुंच योग्य नहीं हैं” और डेटा निष्कर्षण मानदंड को परिभाषित करें।

प्रारंभिक बिंदु प्रयुक्त नमूना है। ये पेज वेब रिपॉजिटरी से लिए गए हैं आम क्रॉल, एक गैर-लाभकारी संगठन जो संपूर्ण वेब को क्रॉल करता है और अपने अभिलेख और डेटासेट जनता को निःशुल्क प्रदान करता है। संग्रह में 2008 से एकत्र किए गए डेटा के पेटाबाइट शामिल हैं। आमतौर पर, स्कैन हर महीने पूरे किए जाते हैं, इसलिए प्यू शोधकर्ताओं को सावधानी से लेना और विश्लेषण करना पड़ा 120 पैकेज, प्रत्येक 2013 से शुरू होकर 2023 तक एक विशिष्ट वर्ष के एक महीने के अनुरूप है। इसलिए विश्लेषण के लिए तुलना की आवश्यकता होती है, निश्चित रूप से किसी व्यक्ति द्वारा नहीं, बल्कि एक द्वारा की जाती है। सॉफ़्टवेयर रूटीन (पायथन प्रोग्रामिंग भाषा का उपयोग करके बनाया गया), एक निश्चित पते पर मौजूद सामग्री और एक विशेष तिथि के अनुरूप और उसी पते पर आज मौजूद सामग्री के बीच। इस परीक्षण का परिणाम इसके अलावा अन्य परिणाम नहीं दे सकता:

  • त्रुटि 204 (कोई सामग्री नहीं)
  • त्रुटि 400 (ख़राब अनुरोध)
  • 404 त्रुटि (पेज नहीं मिला)
  • त्रुटि 410 (पृष्ठ हटा दिया गया)
  • त्रुटि 500 ​​- आंतरिक सर्वर त्रुटि)
  • त्रुटि 501 (अनुरोध विधि में त्रुटि)
  • त्रुटि 502 (कनेक्शन त्रुटि)
  • त्रुटि 503 सेवा अनुपलब्ध)
  • त्रुटि 523 (सामग्री स्रोत पहुंच योग्य नहीं)

या से:

  • पेज थोड़ा संशोधित
  • पृष्ठ मौलिक रूप से संशोधित
  • पता जो किसी अन्य सामग्री (स्थानांतरित पृष्ठ) को संदर्भित करता है जो पिछले 2 मामलों में आ सकता है।

नमूने में केवल ये हैं:

  • सरकारी वेबसाइटों के पृष्ठ (.gov डोमेन प्रदाता डेटा के माध्यम से पहचाने गए)
  • समाचार साइटें (ऑडियंस मेट्रिक्स कंपनी "कॉमस्कोर" के डेटा का उपयोग करके पहचानी गईं)
  • ऑनलाइन विश्वकोश विकिपीडिया के पृष्ठ
  • सोशल मीडिया एक्स/ट्विटर पर व्यक्तिगत सार्वजनिक पोस्ट के पेज

रिपोर्ट संकलित करने के लिए, शोधकर्ताओं ने केवल इस पर ध्यान केंद्रित किया कोडित त्रुटियाँ (त्रुटि 204 से त्रुटि 523 तक), यानी उन पृष्ठों पर जो वास्तव में विभिन्न कारणों से अब किसी भी तरह से उपलब्ध नहीं हैं। अभिगम्यता की अन्य परिभाषाएँ शोध के दायरे से बाहर हैं। इसके बाद पन्नों पर विचार किया गया अन्य सभी मामलों में पहुंच योग्य, जिसमें अस्पष्ट स्थितियाँ शामिल हैं जहाँ सामग्री के अस्तित्व की गारंटी नहीं दी जा सकती है, जैसे कि "सॉफ्ट 404" पृष्ठ या DNS के कारण न होने वाला टाइमआउट (अर्थात मूल पृष्ठों को पुनः प्राप्त करने के लिए बहुत लंबा इंतजार करना)।

अध्ययन के वस्तुनिष्ठ निष्कर्ष यह हैं 2013 और 2023 के बीच मौजूद सभी वेब पेजों में से लगभग एक चौथाई अब पहुंच योग्य नहीं हैं (ऊपर बताए गए अर्थ में) अक्टूबर 2023 से शुरू हो रहा है। ज्यादातर मामलों में, यह इस तथ्य के कारण है कि किसी अन्यथा कार्यशील वेबसाइट पर एक पृष्ठ हटा दिया गया है या हटा दिया गया है। यानी, यह व्यक्तिगत सामग्री है जिसे हटा दिया गया है, पूरी साइट नहीं।

उदाहरण के लिए, 23% समाचार वेब पेजों में कम से कम एक टूटा हुआ लिंक होता है, जैसा कि 21% सरकारी साइट वेब पेजों में होता है। उच्च स्तर की ट्रैफ़िक वाली और निम्न स्तर वाली समाचार साइटों में टूटे हुए लिंक होने की समान संभावना है। इसकी विशेष संभावना है कि स्थानीय स्तर पर सरकारी वेब पेज (शहर प्रशासन से संबंधित) में टूटी कड़ियाँ हैं। विकिपीडिया पृष्ठों का 54% "संदर्भ" अनुभाग में कम से कम एक लिंक शामिल है जो एक ऐसे पृष्ठ की ओर इशारा करता है जो अब मौजूद नहीं है। पर एक्स/ट्विटर, लगभग पाँच में से एक ट्वीट अब प्रकाशित होने के कुछ महीनों बाद भी सार्वजनिक रूप से दिखाई नहीं देता है। इनमें से 60% मामलों में, मूल रूप से ट्वीट पोस्ट करने वाले खाते को निजी बना दिया गया, निलंबित कर दिया गया, या पूरी तरह से हटा दिया गया। शेष 40% में, खाता स्वामी ने व्यक्तिगत ट्वीट हटा दिया है, लेकिन खाता अभी भी मौजूद है। कुछ प्रकार के ट्वीट दूसरों की तुलना में अधिक बार गायब हो जाते हैं। 40% से अधिक ट्वीट लिखे गए तुर्की या अरबी में प्रकाशन के तीन महीने के भीतर वे साइट पर दिखाई नहीं देते हैं। और डिफ़ॉल्ट प्रोफ़ाइल सेटिंग्स वाले खातों के ट्वीट सार्वजनिक दृश्य से गायब होने की अधिक संभावना है।

इन आंकड़ों का क्या मतलब है?

एक बार फिर, एक आधार की आवश्यकता है: हम इस बात से इनकार नहीं कर सकते कि कुछ रहे होंगे वर्गीकरण त्रुटियाँ डेटा को "उपलब्ध नहीं" के रूप में लेबल किया गया। ऐसा इसलिए है, क्योंकि सुरक्षा कारणों से, कुछ साइटें सक्रिय रूप से इस जांच के माध्यम से प्राप्त स्वचालित डेटा संग्रह के प्रकार को रोकने का प्रयास करती हैं। इतना कहने के बाद, 10 साल के भीतर कोई पेज इंटरनेट से गायब क्यों हो जाता है, इसके वैध से भी अधिक और जिन पर कोई चिंता या अफसोस नहीं होना चाहिए, कारण ये हो सकते हैं:

  • यूरोपीय डेटा संरक्षण कानून (जीडीपीआर) के तहत निष्कासन
  • भूल जाने के अधिकार से संबंधित यूरोपीय संघ के न्यायालय (सीजेईयू) के निर्णय के अनुसार और उसके उद्देश्यों के लिए निष्कासन
  • सामान्य तौर पर कानून द्वारा लगाया गया निष्कासन (मानहानि, चिंता पैदा करना, गुप्त प्रेस, विभिन्न व्यवसायों का अपमानजनक अभ्यास, आदि...)
  • सामग्री के अब वैध नहीं होने और इस संबंध में अपडेट की कमी के कारण निष्कासन
  • पृष्ठों के भीतर मौजूद जानकारी की समाप्ति
  • सशुल्क लैंडिंग पृष्ठ, अब उपयोग नहीं किया जाता
  • डोमेन रखरखाव के लिए भुगतान करने में विफलता
  • कॉपीराइट का उल्लंघन
  • एक संपादकीय परियोजना का समर्थन करने के लिए धन की कमी
  • स्व-संशोधन (एक्स/ट्विटर)
  • सबूतों को स्वैच्छिक रूप से छिपाना
  • वेबसाइट माइग्रेशन का ख़राब प्रबंधन
  • अनैच्छिक रद्दीकरण
  • स्वचालित अनुवाद प्रणालियों को निष्क्रिय करना
  • स्वचालित सामग्री निर्माण प्रणालियों को निष्क्रिय करना
  • सामग्री एकत्रीकरण प्रणालियों को निष्क्रिय करना
  • उचित पुनर्निर्देशन के बिना पृष्ठ URL में भिन्नता

संक्षेप में, वेब पर सामग्री तैयार करने वालों के व्यवहार के संकेत के रूप में इस डेटा का उपयोग करने में सक्षम होने की कोई गुंजाइश नहीं है। यह स्थापित करना भी संभव नहीं है कि वर्षों बाद इंटरनेट पेजों का गायब होना, चाहे वह अच्छा हो या बुरा. कभी-कभी, यह केवल कानून के अनुपालन, राजनीतिक या व्यक्तिगत निर्णय, सुधार या अपडेट के बारे में होता है। शायद एकमात्र वैध प्रतिबिंब वह है जो इंटरनेट के तथाकथित "सक्रिय उपयोगकर्ताओं" की ज़िम्मेदारी के इर्द-गिर्द घूमता है, यानी, उन सभी की, जो किसी न किसी तरह से, वेब की कुछ सामग्री उत्पन्न करते हैं : चाहे वे ऑनलाइन विश्वकोश "विकिपीडिया" या सोशल नेटवर्क एक्स/ट्विटर के साधारण योगदानकर्ता हों, चाहे वे डिजिटल प्रकाशक हों या इस या उस सरकारी साइट के लिए जिम्मेदार हों। अक्सर, ये विषय इंटरनेट पर जानकारी खोजने में कठिनाई, परिणामों की असंगतता या इससे भी बदतर, अपने पसंदीदा स्रोतों की असंतोषजनक स्थिति के बारे में शिकायत करते हैं, यह भूल जाते हैं कि वे स्वयं समस्या का हिस्सा हैं। किसी ऐसे व्यक्ति का उदाहरण, जो उचित पुनर्निर्देशन किए बिना किसी पृष्ठ के यूआरएल को बदलकर, इंटरनेट को केवल बदतर जगह बनाता है: डिजिटल कचरे से भरी एक आभासी दुनिया, जो कई अनुरोधों से बनी है जो बहरे कानों पर पड़ती है और, साथ ही, ऐसी सामग्री जो अब उपलब्ध नहीं होगी। इंटरनेट, चूँकि इसे समेकित किया गया था, इसका अपना है जालसाज (उपयोगकर्ताओं के लिए आचरण के अच्छे नियम) जिन्हें हर किसी को पढ़ना चाहिए और उनका सम्मान करना चाहिए*।

यदि, अंतिम विश्लेषण में, कोई ऐसा व्यक्ति था जो मानता था कि इंटरनेट पेजों का गायब होना, जहां इसे लगाया गया था, हमेशा एक बुरी बात थी, तो उन्हें यह सुनिश्चित करने के लिए काम करने के अलावा कुछ नहीं करना होगा। विशिष्ट कानूनों को बदलें, रद्दीकरण का कारण।

*देखना टिप्पणियों के लिए अनुरोध: 1855 (नेटिकेट दिशानिर्देश): “याद रखें कि एक सूचना सेवा स्थापित करना केवल डिजाइन और कार्यान्वयन से कहीं अधिक है। यह रखरखाव भी है”।

समीक्षा