EU में ChatGPT के Text की पहचान के लिए नया कदम
OpenAI ने AI-generated text की पहचान आसान बनाने के लिए नई watermarking technology पेश करने की घोषणा की है।
कंपनी के मुताबिक, आने वाले हफ्तों में European Union में eligible ChatGPT और Codex users के text outputs में invisible watermark शामिल किया जाएगा। यह व्यवस्था EU में सभी plans के eligible users तक चरणबद्ध तरीके से पहुंचाई जाएगी।
यह watermark सामान्य पाठक को दिखाई नहीं देगा। इसका उद्देश्य software और विशेष detection systems को यह संकेत देना है कि किसी text में OpenAI के system से जुड़े provenance signals मौजूद हैं।
textGrain क्या है और कैसे काम करता है?
OpenAI ने अपनी text-watermarking technology को textGrain नाम दिया है।
यह text में hidden characters, invisible spaces या कोई दिखाई देने वाला label नहीं जोड़ती। इसके बजाय model जब अगला word या word-piece चुनता है, तब textGrain उन choices के statistical pattern को सूक्ष्म रूप से प्रभावित करता है।
एक compatible detector बाद में उसी pattern को खोज सकता है। यानी text सामान्य रूप से पढ़ने और copy-paste करने पर अलग दिखाई नहीं देगा।
इसका मतलब यह भी है कि “invisible watermark” को document के अंदर छिपे हुए किसी tag की तरह समझना सही नहीं होगा। Signal स्वयं शब्दों के statistical selection pattern में होता है।
EU AI Act के कारण हो रहा बदलाव
OpenAI ने इस rollout को European Union के AI Act की transparency requirements से जोड़ा है।
कंपनी के अनुसार EU AI Act generative-AI providers से generated text को machine-readable तरीके से identifiable बनाने की मांग करता है। OpenAI ने EU Code of Practice on Transparency of AI-Generated Content के तहत अपनी commitments का भी उल्लेख किया है।
इसका व्यापक उद्देश्य AI-generated material की provenance यानी उसके संभावित origin के बारे में ज्यादा transparency उपलब्ध कराना है।
क्या EU के बाहर भी ChatGPT Text पर Watermark होगा?
फिलहाल नहीं—कम से कम global default के रूप में नहीं।
OpenAI ने साफ किया है कि launch के समय text watermarking को दुनिया भर के ChatGPT users के लिए default नहीं बनाया जा रहा। शुरुआती consumer rollout EU तक सीमित रहेगा।
हालांकि API customers के लिए व्यवस्था अलग है।
5 अक्टूबर से दुनिया भर के OpenAI API customers select models के लिए text watermarking को opt in करके चालू कर सकते हैं। API में यह setting default रूप से बंद रहेगी। कंपनी cloud partners के जरिए मिलने वाले OpenAI model outputs में भी watermarking उपलब्ध कराने पर काम कर रही है।
क्या Watermark से पता चलेगा कि Text किसने लिखा?
नहीं।
OpenAI ने विशेष रूप से चेतावनी दी है कि watermark मिलने का मतलब यह साबित करना नहीं है कि किसी विशेष व्यक्ति ने text लिखा, उसका मालिक कौन है या उसकी कानूनी जिम्मेदारी किसकी है।
Detector यह भी नहीं बता सकता कि किसी document का कितना हिस्सा इंसान ने लिखा और कितना AI ने तैयार या edit किया।
इसलिए watermark को authorship detector समझना गलत होगा।
यह मुख्य रूप से इस बात का signal है कि OpenAI system ने text को generate या process किया हो सकता है।
Detection 100% सटीक नहीं
इस technology की सबसे महत्वपूर्ण limitation इसकी reliability है।
OpenAI खुद मानता है कि detector दो प्रकार की गलतियां कर सकता है—वह ऐसे text में watermark detect कर सकता है जहां वह मौजूद नहीं है, यानी false positive, या मौजूद watermark को पहचानने में असफल हो सकता है, यानी false negative।
छोटे text में detection विशेष रूप से कठिन हो सकती है। इसी तरह substantial rewriting, paraphrasing या translation watermark को detect करना मुश्किल बना सकती है।
इसलिए किसी text में watermark नहीं मिलने का अर्थ यह नहीं है कि वह निश्चित रूप से किसी इंसान ने ही लिखा है।
छोटे Text और Code को लेकर भी सीमाएं
EU transparency framework में कुछ महत्वपूर्ण exceptions भी हैं।
OpenAI Help Center के अनुसार EU AI Act Code of Practice में 200 tokens से छोटे outputs—अंग्रेजी में मोटे तौर पर 150 शब्द—और code snippets के लिए watermark requirement लागू नहीं होती।
इसलिए “ChatGPT और Codex का हर output watermark होगा” कहना सटीक नहीं होगा।
Coverage eligible outputs और applicable requirements पर निर्भर करेगी।
Detector आम Users के लिए अभी उपलब्ध नहीं होगा
Watermark जोड़ने के साथ OpenAI detector भी विकसित कर रहा है, लेकिन इसे शुरुआत में सार्वजनिक नहीं किया जाएगा।
कंपनी ने approved researchers और expert organisations के लिए detector access के applications खोल दिए हैं। Access case-by-case basis पर दिया जाएगा ताकि technology की reliability और limitations का मूल्यांकन किया जा सके।
OpenAI के अनुसार detector watermark की मौजूदगी का signal देगा, लेकिन user की पहचान, prompts या conversations उजागर नहीं करेगा।
कंपनी ने false positives और missed watermarks के जोखिम को public detector तुरंत जारी न करने के कारणों में शामिल किया है।
क्या Watermark ChatGPT की Quality को प्रभावित करेगा?
OpenAI का कहना है कि उसके internal evaluations में watermarking से model performance में meaningful गिरावट नहीं दिखाई दी।
कंपनी के मुताबिक watermarked और non-watermarked outputs के benchmark results में अंतर सामान्य evaluation variation के भीतर रहा। Text watermarking का generation speed पर भी negligible प्रभाव बताया गया है।
हालांकि ये परिणाम OpenAI के अपने evaluations पर आधारित हैं। Real-world rollout के बाद अलग-अलग languages, writing styles और editing patterns में technology का प्रदर्शन महत्वपूर्ण रहेगा।
AI Content की पहचान के लिए क्यों महत्वपूर्ण है यह कदम?
Generative AI tools के व्यापक इस्तेमाल के साथ यह पहचान करना मुश्किल होता जा रहा है कि कोई article, essay, social-media post या दूसरा text इंसान ने लिखा है या AI system की मदद से तैयार हुआ है।
Watermarking इस समस्या का पूर्ण समाधान नहीं देता, लेकिन provenance का अतिरिक्त signal उपलब्ध करा सकता है।
यह publishers, researchers, platforms और regulators के लिए उपयोगी हो सकता है—खासकर उन परिस्थितियों में जहां AI-generated material की transparency महत्वपूर्ण है।
लेकिन इसकी limitations भी उतनी ही महत्वपूर्ण हैं। अगर substantial editing से signal कमजोर हो सकता है और detector false positives दे सकता है, तो watermark को अकेले निर्णायक प्रमाण के रूप में इस्तेमाल करना जोखिमपूर्ण होगा।
OpenAI पहले Images और Audio में भी Provenance Signals इस्तेमाल कर रहा है
Text watermarking OpenAI की broader content-provenance strategy का हिस्सा है।
कंपनी supported AI-generated images में Content Credentials और SynthID जैसे provenance signals इस्तेमाल करती है, जबकि supported generated audio में भी invisible watermarking लागू है। Text के लिए अब textGrain इस framework का नया हिस्सा बन रहा है।
अंतर यह है कि textGrain का initial default consumer rollout EU तक सीमित रहेगा।
Users के लिए क्या बदलेगा?
EU में eligible ChatGPT और Codex users को सामान्य तौर पर generated text में कोई visible watermark दिखाई नहीं देगा।
Text को पढ़ने या copy करने का अनुभव भी सामान्य रहना चाहिए, क्योंकि watermark hidden characters जोड़ने के बजाय statistical word-selection pattern के जरिए काम करता है।
बड़ा बदलाव background में होगा: supported text में ऐसा provenance signal मौजूद हो सकता है जिसे authorised detection system पहचान सके।
इसलिए यह कदम AI-generated text को पूरी तरह “detectable” बनाने से ज्यादा AI provenance को बेहतर करने की कोशिश है—और OpenAI स्वयं मानता है कि technology अभी perfect नहीं है।
