Skip to main content
AI Technology

AI कंपनियां प्रशिक्षण डेटा की उत्पत्ति कैसे साबित करती हैं और कॉपीराइट दावों का बचाव कैसे करती हैं

In short

मॉडल को प्रशिक्षित करते समय AI कंपनियों को दो अलग-अलग जोखिमों का सामना करना पड़ता है: EU AI Act के आर्टिकल 10 की डेटा गवर्नेंस आवश्यकताएं, और प्रशिक्षण डेटा को लेकर सिविल कॉपीराइट दावे। यहां बताया गया है कि एक बचाव योग्य डेटासेट उत्पत्ति रिकॉर्ड में वास्तव में क्या होना चाहिए, और डेटासेट हैश पर एक क्वालिफाइड टाइमस्टैंप क्या साबित कर सकता है और क्या नहीं।

AI कंपनियां प्रशिक्षण डेटा की उत्पत्ति कैसे साबित करती हैं और कॉपीराइट दावों का बचाव कैसे करती हैं — Swiss Trust Layer

किसी भी टीम द्वारा AI मॉडल को प्रशिक्षित करते समय दो अलग-अलग कानूनी जोखिम सामने आते हैं, और ये दो अलग दिशाओं से आते हैं। पहला रेगुलेटरी है: 2 अगस्त 2026 से, EU AI Act के आर्टिकल 10 के तहत हाई-रिस्क AI सिस्टम के प्रदाताओं को अपने प्रशिक्षण, वैलिडेशन और टेस्टिंग डेटासेट का दस्तावेजीकरण करना आवश्यक है, जिसमें डेटा संग्रह प्रक्रियाएं और डेटा की उत्पत्ति शामिल है। दूसरा सिविल है: एक कॉपीराइट धारक यह दावा कर सकता है कि उसके काम का उपयोग बिना अनुमति के किया गया, और यह साबित करने की जिम्मेदारी AI कंपनी पर आती है कि उसने वास्तव में किस डेटा का उपयोग किया और वह कैसे प्राप्त किया गया।

दोनों जोखिम एक ही सवाल के अलग-अलग रूप पूछते हैं: डेटासेट में क्या है, वह कहां से आया, और आपको वह कब मिला। व्यवहार में "उत्पत्ति" (provenance) का यही मतलब है, और यह स्पष्ट करना जरूरी है कि एक टाइमस्टैंप किया गया रिकॉर्ड क्या साबित कर सकता है और क्या नहीं।

आर्टिकल 10 वास्तव में क्या मांगता है

आर्टिकल 10 हाई-रिस्क AI सिस्टम पर लागू होता है और उन डेटा गवर्नेंस प्रथाओं को निर्धारित करता है जो एक प्रदाता के पास होनी चाहिए। इन दायित्वों में डेटा संग्रह में किए गए डिज़ाइन निर्णय, डेटा संग्रह प्रक्रिया स्वयं और डेटा की उत्पत्ति, एनोटेशन, लेबलिंग और सफाई जैसे तैयारी चरण, यह आकलन कि क्या डेटासेट अपने इच्छित उद्देश्य के लिए प्रासंगिक और पर्याप्त रूप से प्रतिनिधि है, और संभावित पूर्वाग्रह (bias) की जांच शामिल है। जहां एक प्रदाता ऐसी कमियां पहचानता है जो अनुपालन को रोकती हैं, वहां उसे भी दस्तावेज करना आवश्यक है।

इनमें से कोई भी किसी कंपनी से यह साबित करने के लिए नहीं कहता कि उसने प्रशिक्षण सेट में हर कॉपीराइट को क्लियर किया है। आर्टिकल 10 एक डेटा-गुणवत्ता और गवर्नेंस व्यवस्था है, कॉपीराइट-क्लियरेंस व्यवस्था नहीं। लेकिन इसका अच्छी तरह जवाब देने के लिए वही अंतर्निहित रिकॉर्ड चाहिए जो एक कॉपीराइट बचाव के लिए भी चाहिए: कौन सा डेटा शामिल हुआ, वह कहां से आया, और कब।

अलग सिविल जोखिम

AI प्रशिक्षण प्रथाओं के खिलाफ कॉपीराइट दावे कई न्यायक्षेत्रों में एक सजीव और सक्रिय मुकदमेबाजी का क्षेत्र हैं, जिसमें प्रकाशकों, लेखकों, संगीत अधिकार धारकों और इमेज लाइब्रेरी द्वारा प्रमुख AI डेवलपर्स के खिलाफ मामले दर्ज किए गए हैं। कानूनी सिद्धांत न्यायक्षेत्र और मामले के अनुसार भिन्न होते हैं, और अदालतें अभी भी मूल सवालों पर काम कर रही हैं, जैसे कि कॉपीराइट युक्त सामग्री पर प्रशिक्षण एक ट्रांसफॉर्मेटिव उपयोग है या नहीं, और लाइसेंसिंग दायित्व डेटा माइनिंग अपवादों के साथ कैसे इंटरैक्ट करते हैं। हम यह अनुमान नहीं लगाने जा रहे कि कोई विशिष्ट मामला किस तरह हल होगा, और एक प्रशिक्षण-डेटा रिकॉर्ड भी उस सवाल को हल नहीं करता।

व्यवहार में, ऐसा दावा वास्तव में किस पर निर्भर करता है, वह है सबूत। यदि एक अधिकार धारक यह आरोप लगाता है कि उसके काम को बिना अनुमति के स्क्रैप किया गया, तो AI कंपनी का जवाब इस बात पर निर्भर करता है कि क्या वह एक ऐसा रिकॉर्ड दिखा सकती है, जो उसने बाद में नहीं लिखा, कि उसने क्या एकत्र किया, कहां से, और किन शर्तों के तहत। जो कंपनी अपनी खुद की डेटा सप्लाई चेन को फिर से नहीं बना सकती, वह एक विशिष्ट शिकायत वाले वादी के खिलाफ स्मृति के आधार पर तर्क कर रही होती है।

डेटासेट के लिए "उत्पत्ति" का व्यावहारिक अर्थ क्या है

प्रशिक्षण डेटासेट के लिए कस्टडी की श्रृंखला (chain of custody) तीन चीजों में विभाजित होती है, जिन्हें अलग-अलग ट्रैक करना उचित है:

  • अधिग्रहण रिकॉर्ड (Acquisition record)। किसी स्रोत को कॉर्पस में कब जोड़ा गया, किस URL, API, लाइसेंसदाता, या विक्रेता से, और उस समय उस स्रोत की शर्तों के किस संस्करण के तहत।
  • लाइसेंसिंग रिकॉर्ड। यदि कोई हो, तो कौन सा समझौता उपयोग को कवर करता है, चाहे वह प्रत्यक्ष लाइसेंस हो, प्लेटफॉर्म की सेवा-शर्तों द्वारा दी गई अनुमति हो, एक ओपन लाइसेंस हो, या डिजिटल सिंगल मार्केट कॉपीराइट डायरेक्टिव के आर्टिकल 4 जैसे टेक्स्ट-एंड-डेटा-माइनिंग अपवाद पर निर्भरता हो, और क्या अधिकार धारक ने उस अपवाद के खिलाफ मशीन-रीडेबल तरीके से अधिकार आरक्षित किए थे।
  • इंटीग्रिटी रिकॉर्ड। यह प्रमाण कि आज कंपनी जिस डेटासेट की ओर इशारा कर रही है, वही वह है जिस पर उसने वास्तव में प्रशिक्षण दिया, न कि विवाद के प्रयोजनों के लिए बाद में तैयार किया गया एक पुनर्निर्माण।

इन तीनों में से, इंटीग्रिटी रिकॉर्ड वह है जिसके लिए ज्यादातर टीमों के पास कोई अच्छा जवाब नहीं होता। अधिग्रहण और लाइसेंसिंग रिकॉर्ड अक्सर बिखरे हुए ईमेल, विक्रेता अनुबंधों और आंतरिक विकी में पड़े रहते हैं। जहां वे मौजूद भी होते हैं, वहां अक्सर यह साबित करने का कोई तरीका नहीं होता कि उन दस्तावेजों में संदर्भित डेटासेट वही फाइलों का सेट है जिस पर महीनों या वर्षों बाद मॉडल को वास्तव में प्रशिक्षित किया गया था।

एक क्वालिफाइड टाइमस्टैंप क्या साबित करता है, और क्या नहीं

अधिग्रहण के समय एक डेटासेट के क्रिप्टोग्राफिक हैश को क्वालिफाइड टाइमस्टैंप के साथ सील करना एक बचाव योग्य रिकॉर्ड बनाता है कि बाइट्स का एक विशिष्ट सेट अस्तित्व में था और एक विशिष्ट समय पर आपके पास था। यह एक संकीर्ण लेकिन वास्तव में उपयोगी दावा है। इसका मतलब है कि आप महीनों या वर्षों बाद किसी अदालत को ठीक-ठीक दिखा सकते हैं कि डेटासेट कैसा दिखता था जब आपने उसे एकत्र किया था, बिना अपनी खुद की बात पर या ऐसे दस्तावेज पर भरोसा किए जिसे बाद में संपादित किया जा सकता था।

इस दावे की सीमाओं के बारे में स्पष्ट रहना जरूरी है, क्योंकि इसे बढ़ा-चढ़ाकर पेश करना इसे न करने से भी बदतर है। एक सील किया गया हैश एक विशिष्ट समय पर अस्तित्व और अधिकार में होने को साबित करता है। यह यह साबित नहीं करता कि आपके पास सामग्री का उपयोग करने की अनुमति थी, और यह भी साबित नहीं करता कि सामग्री शुरुआत में कानूनी रूप से प्राप्त की गई थी। लाइसेंसिंग और अनुमति अलग कानूनी सवाल हैं जिन्हें एक टाइमस्टैंप अकेले हल नहीं कर सकता। यह जो करता है वह है विवाद की एक पूरी श्रेणी को हटाना, यानी क्या आप यह भी दिखा सकते हैं कि आपके पास क्या था और कब था, ताकि लाइसेंसिंग शर्तों के बारे में वास्तविक तर्क तथ्यों पर हो सके, न कि इस पर कि अदालत किसकी घटनाओं की व्याख्या पर विश्वास करने को तैयार है।

एक ऐसी कंपनी के लिए जो रेगुलेटर के आर्टिकल 10 डेटा गवर्नेंस के सवाल का सामना कर रही है, या किसी अधिकार धारक के अनधिकृत उपयोग के आरोप का सामना कर रही है, "यह रहा उस सटीक डेटासेट का टाइमस्टैंप किया हुआ हैश, जिस दिन हमने इसे अधिग्रहित किया उस दिन सील किया गया, साथ ही हमारे लाइसेंसिंग रिकॉर्ड" और "हमारा मानना है कि हमने लगभग यही उपयोग किया था" के बीच का अंतर ही एक बचाव योग्य स्थिति और एक असत्यापन योग्य स्थिति के बीच का अंतर है।

यह एक व्यावहारिक वर्कफ़्लो में कहां फिट बैठता है

AI उत्पाद बनाने वाली टीमें, जिन्हें आर्टिकल 10 गवर्नेंस के सवाल और अंतर्निहित कॉपीराइट सवाल दोनों का बचाव करना है, डेटासेट अधिग्रहण को एक चालू, परिवर्तनशील फ़ोल्डर के बजाय एक अलग, सील किए गए इवेंट के रूप में मानने से लाभान्वित होती हैं। अधिग्रहण के समय एक डेटासेट स्नैपशॉट को हैश और सील करें, उस क्षण लागू लाइसेंसिंग शर्तों को जोड़ें, और उस रिकॉर्ड को अलग रखें चाहे बाद में कोई भी डाउनस्ट्रीम सफाई या फ़िल्टरिंग हो। यदि बाद में कोई विवाद आता है, किसी विशिष्ट स्रोत, विशिष्ट तारीख, या विशिष्ट लाइसेंस के बारे में, तो रिकॉर्ड पहले से मौजूद होता है, दबाव में इसे फिर से बनाने की जरूरत नहीं पड़ती।

हमारा AI डेटासेट प्रोवेनेंस पेज बताता है कि यह उन टीमों के लिए कैसे काम करता है जिन्हें डेटासेट में क्या था और यह कब अधिग्रहित किया गया था, इसका एक टाइमस्टैंप किया हुआ, अदालत-स्वीकार्य रिकॉर्ड चाहिए, साथ ही वह लाइसेंसिंग दस्तावेज़ीकरण जो अनुमति के अलग सवाल का जवाब देता है।

एआई सामग्री स्वामित्व की पूरी गाइड देखें

Swiss Trust Layer AG के साथ अपने काम की रक्षा करें

Swisscom Trust Services द्वारा समर्थित न्यायालय-प्रमाणित e-Seal के साथ अपनी बौद्धिक संपदा को सील करें।

मुफ्त डेमो बुक करें

संबंधित लेख

अगर कोई आपसे कंटेंट के अनुपालन का सबूत मांगे, तो आप असल में क्या भेजेंगे?
AI & Technology

जब कोई ग्राहक, प्लेटफॉर्म या नियामक AI कंटेंट के अनुपालन का सबूत मांगता है, तो अकेला डिस्क्लोज़र लेबल काफी नहीं होता। असल में टिकने वाला सबूत यह है: एक टाइमस्टैम्प, एक हस्ताक्षर, कंटेंट का हैश, और एक लिंक जिसे कोई भी आपसे संपर्क किए बिना जांच सके।

10 अगस्त 2026लेख पढ़ें
सप्ताह की समीक्षा: अनुच्छेद 50, कॉपीराइट प्रमाण, और क्या बदला
AI & Technology

अनुच्छेद 50 2 अगस्त से लागू है। इस पर एक सप्ताह का लेखन एक विचार पर आ टिकता है: नियम आपसे एक कथन मांगता है, और कथन उतना ही मूल्यवान है जितना वह जो आप तब प्रस्तुत कर सकें जब कोई उसका समर्थन मांगे।

8 अगस्त 2026लेख पढ़ें
हर यूरोपीय प्रकाशक को चाहिए ये चार AI लेबल, और हर एक का अर्थ क्या है
AI & Technology

AI-उत्पन्न, AI-परिवर्तित, AI-सहायता प्राप्त, मानव-रचित। चार कथन लगभग वह सब कवर करते हैं जो कोई प्रकाशन टीम बनाती है। इनमें अंतर क्या है, एक मिनट में कैसे तय करें, और गलत लेबल अनुपस्थित लेबल से बुरा क्यों है।

4 अगस्त 2026लेख पढ़ें
चेकबॉक्स प्रमाण नहीं है: AI Act के तहत लेबलिंग बनाम साक्ष्य
AI & Technology

पृष्ठ पर लेबल और अभिलेख एक जैसे दिखते हैं और जैसे ही कोई उन पर प्रश्न उठाता है, बिल्कुल अलग व्यवहार करते हैं। स्व-घोषणा को प्रमाण से क्या अलग करता है, सामान्य आंतरिक रिकॉर्ड यह अंतर क्यों नहीं पाटते, और योग्य टाइमस्टैम्प क्या बदलता है।

3 अगस्त 2026लेख पढ़ें
अनुच्छेद 50 आज से लागू है। अपनी सामग्री के अनुपालन को इस तरह सिद्ध करें।
AI & Technology

EU AI Act के अनुच्छेद 50 की पारदर्शिता बाध्यताएं आज से लागू हैं। यह बाध्यता वास्तव में क्या मांगती है, अकेला लेबल प्रमाण का भार आप पर क्यों छोड़ देता है, और ऐसे अभिलेख के वे चार हिस्से कौन-से हैं जिन्हें आपके संगठन के बाहर का कोई व्यक्ति जांच सके।

2 अगस्त 2026लेख पढ़ें