Skip to content

ڈیٹا کا سلسلہ: آپ کا تربیتی ڈیٹا کہاں سے آیا

Data lineage: knowing where your training data came from

36 منٹ

تین طریقے

  1. ڈیٹا کا سلسلہ ہر تربیتی اور فائن ٹیوننگ ڈیٹم کے اصل ذریعے سے ماڈل کے وزن اور پھر ماڈل کے نتیجے تک دستاویزی حراست کا سلسلہ ہے۔ یہ ہر استعمال شدہ ڈیٹا سیٹ کے لیے چار سوال کا جواب دیتا ہے۔ اصل میں کہاں سے آیا؟ کس لائسنس یا رضامندی کے تحت جمع ہوا؟ جمع اور تربیت کے درمیان کیا تبدیلیاں ہوئیں؟ ابھی اسے مٹانے کا حق کس کو ہے؟ اگر سلسلے کا کوئی جوڑ گم ہو، تو سلسلہ ٹوٹا ہوا، اور ریگولیٹر، عدالت یا صحافی پورے سسٹم کو اسی کمزور جگہ سے کاٹ سکتے ہیں۔

  2. پاکستانی سیاق میں سلسلے کا سوال تین متوازی فکروں کی وجہ سے زیادہ تیز ہو جاتا ہے۔ PII: نام، شناختی کارڈ، فون نمبر، پتے، اور اب بایومیٹرک ڈیٹا، Personal Data Protection Bill کے مسودے اور نادرا کے شناختی کارڈ ضوابط کے تحت۔ خود مختاری: قومی اے آئی پالیسی 2025 پاکستانی شہریوں کے سسٹمز کے لیے ڈیٹا رہائش پاکستان میں ترجیح دیتی ہے۔ مذہبی و ثقافتی حساسیت: سکریپ شدہ پاکستانی متن میں اکثر ایسا مواد جو اپنے اصل سیاق میں مناسب مگر سرکاری چیٹ بوٹ کے لیے نہیں۔ سلسلہ ہی وہ چیز ہے جو تعیناتی سے پہلے تینوں پر سوچنے دیتا ہے۔

  3. عملی سلسلہ ریکارڈ کا فارمیٹ، ہر ڈیٹا سیٹ کی ایک قطار۔ ڈیٹا سیٹ کا نام، ورژن، سائز ٹوکنز یا قطاروں میں۔ ذریعہ URL یا وینڈر اور حصول کی تاریخ۔ اصل جمع کرنے والا اور اصل مقصد۔ لائسنس یا رضامندی۔ زبانیں اور تخمینی تقسیم۔ PII جائزہ: کوئی نہیں، حذف، یا فرضی ناموں سے۔ جغرافیائی ماخذ کی تقسیم۔ موجود حساس زمرے (طبی، مالی، مذہبی، سیاسی)۔ آخری جائزہ تاریخ اور جائزہ لینے والا۔ مٹانے یا تجدید کی منصوبہ بند تاریخ۔ یہ ایک سپریڈ شیٹ، دس کالم، فی ڈیٹا سیٹ ایک قطار۔ زیادہ تر ٹیموں کے پاس 3 سے 30 قطاریں ہوں گی۔ قطار بھرنے کا نظم خود آڈٹ ہے۔

فوری چیک

فوری چیک: جدید AI روایتی قاعدہ بنیاد پروگرام سے کس طرح مختلف ہے؟

کیوں؟

کیوں کا پہلا درجہ: ماخذ کیوں اہم اگر ماڈل 'صرف نمونے سیکھتا ہے'؟ کیونکہ نمونے لفظ بہ لفظ یاد ہو سکتے ہیں، اور قانون فرق کی پروا نہیں کرتا۔ کاپی رائٹ، رازداری اور ڈیٹا تحفظ کا قانون ڈیٹا پر لاگو ہے، تجرید پر نہیں۔ اگر آپ ثابت نہ کر سکیں کیا اندر گیا، تو باہر آنے والے کا دفاع نہیں کر سکتے۔

Claude کے ساتھ آزمائیں

اختتامی چیلنج، تین اقدامات۔ (1) اپنی ٹیم کے ایک ماڈل کے لیے دس کالم سلسلہ قطار بھرنے کی کوشش کریں؛ جو خلا ملیں وہ ترجیحی فہرست ہیں۔ (2) ہر ڈیٹا سیٹ کے لیے پہچانیں کس دائرہ اختیار کا قانون لاگو ہے اور کیا یہ پاکستانی قانون سے ٹکراتا ہے۔ (3) ایک ڈیٹا سیٹ چنیں جس کا سلسلہ صاف نہیں اور آج فیصلہ کریں کہ 30 دن میں دستاویز کریں، بدلیں، یا ہٹا دیں۔

ماخذ

ماخذ اور مزید مطالعہ۔ Personal Data Protection Bill of Pakistan تازہ مسودہ۔ نادرا آرڈیننس 2000 اور شناختی کارڈ ڈیٹا ضوابط۔ امریکی CLOUD Act 2018۔ EU GDPR کا آرٹیکل 30 پراسیسنگ ریکارڈز پر۔ Datasheet for Datasets، Gebru et al، 2021۔ Data Provenance Initiative (dataprovenance.org)۔ Hugging Face ڈیٹا سیٹ کارڈ ہدایات۔ NIST AI RMF MEASURE 2.10 ڈیٹا سالمیت اور ماخذ پر۔ پاکستان قومی اے آئی پالیسی 2025 ڈیٹا خود مختاری کی شقیں۔