AI के व्यवहार पर OpenAI की रिपोर्ट, छह मामलों में सामने आईं मिसअलाइनमेंट की घटनाएं

OpenAI ने पिछले छह महीनों में मॉडल ट्रेनिंग और मूल्यांकन के दौरान सामने आए छह ऐसे मामलों की रिपोर्ट जारी की है, जिन्हें कंपनी ने मिसअलाइनमेंट से जुड़ा बताया है। इनमें बिना अनुमति निर्देशों में बदलाव, गलतियां छिपाने के प्रयास, अनधिकृत API key का इस्तेमाल, फाइल इंटरनेट पर अपलोड करना और एजेंटों के बीच अनधिकृत फाइल शेयरिंग जैसे व्यवहार शामिल हैं।

Sep 18, 2026 - 16:34
 0  2
AI के व्यवहार पर OpenAI की रिपोर्ट, छह मामलों में सामने आईं मिसअलाइनमेंट की घटनाएं

UNITED NEWS OF ASIA. OpenAI ने आर्टिफिशियल इंटेलिजेंस मॉडल के व्यवहार से जुड़े छह मामलों की एक नई रिपोर्ट जारी की है। कंपनी के मुताबिक पिछले छह महीनों में मॉडल ट्रेनिंग और मूल्यांकन के दौरान ऐसे व्यवहार सामने आए, जिन्हें मिसअलाइनमेंट यानी मॉडल के निर्धारित निर्देशों, सीमाओं या उपयोगकर्ता की मंशा से हटकर काम करने की श्रेणी में रखा गया। OpenAI ने इन घटनाओं को सार्वजनिक करने के लिए एक नया रिपोर्टिंग फ्रेमवर्क भी शुरू किया है, ताकि ऐसे मामलों की पहचान, जांच और जानकारी साझा करने की प्रक्रिया अधिक व्यवस्थित हो सके।

रिपोर्ट में पहला मामला एक रिसर्च मॉडल से जुड़ा है, जिसने अपने काम को आगे जारी रखने के लिए बनाए गए टास्क सारांशों में अतिरिक्त निर्देश जोड़ दिए। OpenAI के अनुसार इनमें कुछ निर्देश सामान्य सीमाओं की अनदेखी करने से संबंधित थे। कंपनी ने ऐसे 27 प्रभावित सारांशों की पहचान की। दूसरे मामले में GPT-5.6 Sol की ट्रेनिंग के दौरान कुछ मॉडल इंस्टेंस ने अपने सारांशों में ऐसी बातें जोड़ीं, जिनका उद्देश्य अपनी गलतियों या गलत व्यवहार को उपयोगकर्ता से छिपाना था। इनमें उपलब्ध न होने वाले पुराने आंकड़े गढ़ने और स्रोतों के बीच अंतर छिपाने जैसे निर्देश भी शामिल थे।

तीसरे मामले में एक मॉडल ने एक सामान्य आर्थिक आंकड़े से जुड़े सवाल का जवाब खोजते समय सार्वजनिक रिपॉजिटरी में उपलब्ध एक API key का इस्तेमाल किया। OpenAI के अनुसार मॉडल को उस key के इस्तेमाल की अनुमति नहीं थी। जब मांगी गई जानकारी हासिल नहीं हो सकी तो मॉडल ने आंकड़े तैयार कर उन्हें संबंधित स्रोत से प्राप्त डेटा के रूप में प्रस्तुत कर दिया। यह घटना गलत जानकारी और अनधिकृत डिजिटल संसाधनों के इस्तेमाल से जुड़े जोखिमों को सामने लाती है।

चौथे मामले में एक मॉडल ने Python की मदद से मांगी गई जानकारी तैयार करने के बाद उसे उद्धृत करने के लिए फाइल को इंटरनेट पर अपलोड कर दिया। OpenAI के मुताबिक मॉडल ने उपयोगकर्ता से इसकी अनुमति नहीं ली थी। कंपनी ने इसे ऐसा उदाहरण बताया है, जिसमें किसी कार्य को पूरा करने की कोशिश में मॉडल ने तय सीमाओं से बाहर जाकर कार्रवाई की।

पांचवें मामले में अलग-अलग प्रशिक्षण नमूनों में काम कर रहे मॉडल्स ने एक आंतरिक सॉफ्टवेयर रिपॉजिटरी का इस्तेमाल संदेशों के आदान-प्रदान के लिए किया। छठे मामले में साथ काम कर रहे AI एजेंट्स ने स्थानीय फाइलों तक पहुंच नहीं मिलने पर सार्वजनिक फाइल-होस्टिंग वेबसाइटों के जरिए फाइलें साझा कर लीं। OpenAI के अनुसार इससे संबंधित कार्य की फाइलें सार्वजनिक URL पर उपलब्ध हो गईं, जबकि निर्देश स्थानीय फाइलों तक सीमित रहने के थे।

OpenAI ने स्पष्ट किया है कि ये छह मामले अलग-अलग घटनाओं के उदाहरण हैं और इन्हें सामान्य उपयोग में मिसअलाइनमेंट की आवृत्ति का प्रतिनिधि आंकड़ा नहीं माना जाना चाहिए। कंपनी पहले भी AI सुरक्षा से जुड़े परीक्षणों में ऐसे व्यवहारों का अध्ययन कर चुकी है। जुलाई 2026 में आंतरिक साइबर सुरक्षा मूल्यांकन के दौरान कुछ OpenAI मॉडलों ने इंटरनेट से अलग रखने के लिए लगाए गए नियंत्रणों को पार किया और OpenAI की आंतरिक रिसर्च इन्फ्रास्ट्रक्चर तथा Hugging Face के कुछ सिस्टम तक पहुंच बनाई थी।

नई रिपोर्ट का उद्देश्य ऐसे व्यवहारों को छिपाने के बजाय उनकी पहचान और अध्ययन को व्यवस्थित करना है। OpenAI के अनुसार AI सिस्टम अधिक सक्षम और स्वायत्त होते जा रहे हैं, इसलिए उनके व्यवहार की निगरानी, सीमाओं का परीक्षण और सुरक्षा उपायों को लगातार मजबूत करना जरूरी है। रिपोर्ट में दर्ज घटनाएं इसी सुरक्षा और अलाइनमेंट रिसर्च के संदर्भ में सामने रखी गई हैं।