Skip to content

ٹوکن کیا ہیں، اور آپ کا بل ان پر کیوں منحصر ہے

What are tokens, and why your bill depends on them

35 منٹ

تین طریقے

  1. ٹوکن نہ لفظ ہے، نہ حرف، نہ ہجا۔ یہ متن کا وہ ٹکڑا ہے جسے ماڈل نے تربیت کے دوران ایک ناقابلِ تقسیم اکائی ماننے کا فیصلہ کیا ہے۔ یہ فیصلہ Byte Pair Encoding یا BPE نامی الگورتھم کرتا ہے جو اربوں الفاظ کو دیکھ کر سب سے زیادہ بار آنے والے ٹکڑے ڈھونڈتا ہے۔ عام انگریزی الفاظ جیسے the، of، is ہر ایک ایک ہی ٹوکن بن جاتے ہیں۔ کم استعمال ہونے والا لفظ reconciliation کئی ٹکڑوں میں بٹ جاتا ہے۔ غیر معروف نام اور اردو کا متن اور بھی سختی سے ٹکڑے ہوتا ہے کیونکہ ماڈل نے انہیں تربیت کے دوران کم بار دیکھا تھا۔

  2. ٹوکن کو سمجھنے کا پہلا طریقہ: انارکلی بازار کی دکان کا تصور کریں۔ دکاندار شے کے حساب سے نہیں، پیکٹ کے حساب سے پیسے لیتا ہے۔ چینی جیسی عام چیز ایک پیکٹ میں آ جاتی ہے۔ زعفران جیسی نایاب چیز کاغذ اور ڈبی میں لپٹی ہوتی ہے، تین پیکٹ بن جاتے ہیں۔ آپ پیکٹ کے حساب سے ادائیگی کرتے ہیں، نہ کہ اصل سامان کے۔ LLM بالکل یہی کرتا ہے۔ Hello world دو ٹوکن ہیں۔ السلام علیکم دنیا تقریباً سات۔ مواد ملتا جلتا ہے، پیکنگ مختلف ہے۔

  3. دوسرا طریقہ: پاکستان پوسٹ کی چھانٹنے والی مشین کا تصور کریں۔ مشین خط پڑھتی نہیں۔ وہ لفافے پر لگے بارکوڈ کو اسکین کر کے خط کو متعلقہ خانے میں ڈال دیتی ہے۔ بارکوڈ ٹوکن آئی ڈی ہے۔ ماڈل کے اندر ہر ٹوکن ایک عدد ہے جو ایک طے شدہ لغت سے آتا ہے، عام طور پر پچاس ہزار سے ایک لاکھ تک۔ ماڈل آپ کے الفاظ کو آپ کی لکھائی میں نہیں دیکھتا۔ وہ ایک عددوں کی قطار دیکھتا ہے، اور اب تک کے پیٹرن کی بنیاد پر اگلا عدد پیش گوئی کرتا ہے۔ لفظ لباس ہے، ٹوکن آئی ڈی شہری شناخت ہے۔

فوری چیک

فوری چیک: جدید AI روایتی قاعدہ بنیاد پروگرام سے کس طرح مختلف ہے؟

کیوں؟

کیوں کا پہلا درجہ: ٹوکن کے حساب سے بل کیوں؟ کیونکہ ماڈل کا اصلی خرچہ، یعنی GPU کا وقت، ڈیٹا سینٹر کی بجلی، میموری بینڈوتھ، ٹوکنوں کی تعداد کے ساتھ بڑھتا ہے۔ ٹوکن کام کی اکائی ہے۔ الفاظ کے حساب سے چارج کرنا سستے ٹوکن والی زبانوں کے ساتھ ناانصافی ہوتی، حروف کے حساب سے زیادہ بائٹ والی رسم الخط والوں کے ساتھ۔ ٹوکن ماڈل کی ایماندار کرنسی ہے۔

Claude کے ساتھ آزمائیں

Claude یا ChatGPT کے ساتھ آزمانے کا پرامپٹ: 'میں پاکستان کے ایک تھنک ٹینک میں پانچ افراد کی تحقیقی ٹیم چلاتا ہوں۔ ہم مہینے میں تقریباً 200 دستاویزات پراسیس کرتے ہیں، زیادہ تر اردو پالیسی پرچے، اوسط 8000 الفاظ فی پرچہ۔ اگر ہم خلاصے کے لیے Claude Sonnet استعمال کریں تو ہماری ماہانہ ٹوکن کھپت کا اندازہ لگائیں۔ جواب ان پُٹ ٹوکن، آؤٹ پُٹ ٹوکن، اور موجودہ Anthropic قیمتوں پر USD میں دیں۔' اس کے جواب کا موازنہ سبق دو میں بنائے گئے کیلکولیٹر سے کریں۔

ماخذ

ماخذ اور مزید مطالعہ۔ Anthropic، Token counting۔ OpenAI، Tokenizer ٹول اور What are tokens۔ tiktoken لائبریری۔ Sennrich, Haddow, Birch کا BPE پر اصل مقالہ۔ Andrej Karpathy کی YouTube ویڈیو Let's build the GPT Tokenizer (صرف تصوراتی سطح پر)۔ Hugging Face Tokenizers لائبریری کی دستاویزات۔

مکمل، اگلا سبق ←