Skip to content

32 منٹ

تین طریقے

  1. آپ نے غالباً ChatGPT میں ٹائپ کیا ہوگا، کسی ساتھی کو Claude میں رپورٹ پیسٹ کرتے دیکھا ہوگا، یا Google کی تلاش میں Gemini کا جواب نمودار ہوتے دیکھا ہوگا۔ چیٹ بوٹ نے رواں انگریزی میں، کبھی قابلِ قبول اردو میں جواب دیا، اور لگا جیسے جواب کسی سوچتے ہوئے ذہن سے آیا۔ ایسا نہیں ہے۔ ان تمام نظاموں کے پیچھے ایک large language model یعنی LLM بیٹھا ہے، اور اس سبق کا مقصد یہی ہے کہ ہم اس اصطلاح کو ٹکڑے ٹکڑے کر کے تب تک کھولیں جب تک یہ لفظ کسی برانڈ کی طرح نہیں بلکہ ایک سمجھی ہوئی چیز کی طرح لگنے لگے۔

  2. پہلے لفظ large سے شروع کرتے ہیں۔ ایک ماڈل اس وقت بڑا کہلاتا ہے جب اس میں بہت سے parameters ہوں۔ parameters وہ قابل تعدیل اعداد ہیں جن میں ماڈل کی ساری سیکھی ہوئی معلومات محفوظ ہوتی ہیں۔ 2019 میں جاری ہونے والے GPT-2 میں قریباً ڈیڑھ ارب parameters تھے اور وہ مشکل سے ایک رواں پیراگراف لکھ پاتا تھا۔ آج کے سرکردہ ماڈل کھربوں parameters پر کام کرتے ہیں۔ 2023 کے بعد سے روانی میں جو چھلانگ آپ نے دیکھی ہے، وہ بڑی حد تک سائز کی چھلانگ ہے۔ بڑے ماڈل زیادہ پڑھتے ہیں، زیادہ تعلق محفوظ کرتے ہیں، اور زیادہ پراعتماد جواب دیتے ہیں۔ ان کا چلانا بھی مہنگا ہے، اور یہ بات اس وقت اہم ہو جاتی ہے جب کسی پاکستانی وزارت کو خریداری کا حکم نامہ لکھنا ہو۔

  3. اب لفظ language پر آئیں۔ ماڈل متن پر تربیت پاتا ہے۔ کھربوں الفاظ کا متن: کھلی ویب سے، کتابوں سے، کوڈ کے مخزن سے، فورمز سے، خبر کی ویب سائٹوں سے، لیک شدہ ڈیٹا سیٹس سے۔ ماڈل یہ متن اس طرح نہیں پڑھتا جیسے بچہ پڑھتا ہے۔ وہ ہر لفظ کو tokens نامی چھوٹے ٹکڑوں میں کاٹتا ہے، انگریزی میں تقریباً چار حروف فی token، اردو میں tokenizer کے حساب سے اکثر پورا لفظ یا آدھا لفظ۔ آپ نے ChatGPT میں جو بھی اردو جملہ ٹائپ کیا ہے، وہ پہلے tokens میں کٹا، پھر ماڈل نے اسے دیکھا۔ آپ کو ملنے والی اردو کے معیار کا انحصار اس بات پر ہے کہ اس تربیتی ڈھیر میں اردو متن کتنا تھا، اور سچا جواب یہ ہے: انگریزی کا پانچ فیصد بھی نہیں۔

فوری چیک

فوری چیک: جدید AI روایتی قاعدہ بنیاد پروگرام سے کس طرح مختلف ہے؟

کیوں؟

LLM کو سمجھنے کا پہلا طریقہ: ایک ایسا اِمکانی نظام جو اگلا token چنتا ہے۔ دوسرا طریقہ: ایک سکیڑی ہوئی یاد جو اس نے پڑھا ہوا متن جوڑ سے نکالتی ہے۔ تیسرا طریقہ: ایک function approximator جس نے انسانی زبان کی شکل سیکھ لی ہے۔ تینوں درست ہیں۔ تینوں ماڈل کے مختلف رویوں کی وضاحت کرتے ہیں۔

ماخذ

آگے پڑھنے کے ذرائع، سادہ انگریزی میں تاکہ آپ آن لائن ڈھونڈ سکیں۔ Anthropic کا Claude model card، جو Anthropic ہر ریلیز پر شائع کرتا ہے۔ OpenAI کے GPT-4 اور GPT-5 system cards، OpenAI کی research سائٹ پر۔ Google کی Gemini technical report، Google DeepMind کی سائٹ پر۔ Meta کے Llama 3 اور Llama 4 model cards، Meta AI کی آفیشل سائٹ پر۔ transformer architecture کا اصل مقالہ، عنوان Attention Is All You Need، Vaswani اور Google کے ساتھیوں کا 2017 کا مقالہ، جو اوپر بیان کیے گئے ہر ماڈل کی بنیادی دستاویز ہے۔ کوئی بھی آسان نہیں، مگر ان میں سے کسی ایک کے پہلے تین صفحے بھی LinkedIn کی سو پوسٹوں سے زیادہ قیمتی ہیں۔

مکمل، اگلا سبق ←