31 منٹ
تین طریقے
2023 تک LLM متن پڑھتا اور متن لکھتا تھا، اور یہی پورا کھیل تھا۔ آج کے سرکردہ ماڈل تصاویر پڑھتے ہیں، آڈیو سنتے ہیں، مختصر ویڈیو دیکھتے ہیں، اور یہ تینوں چیزیں بناتے بھی ہیں۔ تکنیکی لفظ multimodal ہے، اور پاکستانی پیشہ ور کے لیے عملی اثر یہ ہے کہ آپ کے فون میں موجود اسسٹنٹ اب وہ کام کر سکتا ہے جو پہلے کلرکوں کے دفتر کا کام تھا۔ کوئی فیلڈ افسر تباہ شدہ فصل کی تصویر کھینچ کر Gemini کو بھیج سکتا ہے اور اردو میں تشخیص اور تجویز کردہ پیسٹی سائیڈ کی مقدار حاصل کر سکتا ہے۔ بینک کا کلرک گاہک کے CNIC کی تصویر لے سکتا ہے اور ماڈل سے نام، والد کا نام، تاریخِ پیدائش، اور شناختی نمبر فارم میں نکلوا سکتا ہے۔ لاہور میں ٹریفک پولیس کا انسپکٹر ماڈل کو کلمہ چوک کا جام دکھا کر پوچھ سکتا ہے کہ کون سے متبادل راستے جلدی کھلیں گے۔ یہ سائنس فکشن نہیں۔ یہ 2026 کا مفت ٹیر ہے۔
ماڈل کے اندر بصارت کیسے کام کرتی ہے، ایک پیراگراف میں۔ ماڈل کو لاکھوں تصویر اور متن کے جوڑوں پر تربیت دی گئی ہے، جن میں ایک تصویر کے ساتھ ایک کیپشن ہوتا ہے جو اسے بیان کرتا ہے۔ تربیت کے دوران ماڈل تصویر کے اندر کے نمونے، یعنی کناروں کی شکلیں، رنگ، بناوٹ، اور پہچانے جانے والے اشیاء کو، کیپشن کی زبان سے جوڑنا سیکھتا ہے۔ جب آپ سکھر کی سیلابی سڑک کی تصویر اپ لوڈ کرتے ہیں، تو ماڈل وہی ترکیب الٹا چلاتا ہے: pixel کو اندرونی نمائندگی میں تبدیل کرتا ہے، پھر ایک ایسا انگریزی یا اردو جملہ بناتا ہے جو اس نمائندگی کے مطابق ہو۔ ماڈل اس طرح نہیں دیکھتا جیسے آپ دیکھتے ہیں۔ وہ جو دیکھ رہا ہے، اسے پڑھے ہوئے متن سے جوڑتا ہے۔
آڈیو اسی اصول پر چلتا ہے۔ ایک speech to text ماڈل آواز کے نوٹ کو اردو یا انگریزی متن میں تبدیل کرتا ہے، پھر عام LLM اس متن کو پراسس کرتا ہے۔ ایک text to speech ماڈل الٹا کام کرتا ہے: تیار شدہ متن کو آڈیو فائل میں بدلتا ہے، کبھی صارف کی نقل کی ہوئی آواز میں۔ پاکستانی پیشہ ور کے لیے سب سے مفید آڈیو ایپلی کیشن ڈکٹیشن ہے، جس میں آپ اردو میں بولتے ہیں اور انگریزی میں ٹائپ شدہ منٹس پاتے ہیں، ریکارڈ کی گئی میٹنگز کی نقل، اور رسائی، جس میں نابینا یا کم بینائی والے صارفین دستاویز سن سکتے ہیں۔ آواز کی نقل سب سے خطرناک صلاحیت ہے: تیس سیکنڈ کی آواز کا نمونہ بڑے ماڈلز کے لیے کسی کی نقل قائل کن انداز میں کرنے کے لیے کافی ہے، اور یہی وہ تکنیکی وجہ ہے جو پاکستانی عدالتوں میں آنے والے deepfake کے دھوکا دہی کے مقدمات کے پیچھے ہے۔
فوری چیک
فوری چیک: جدید AI روایتی قاعدہ بنیاد پروگرام سے کس طرح مختلف ہے؟
کیوں؟
multimodal کام کی درجہ بندی کے تینوں طریقے۔ ان پُٹ کی بنیاد پر: ماڈل کیا پڑھ رہا ہے، صرف متن یا تصویر، آڈیو، ویڈیو بھی۔ آؤٹ پُٹ کی بنیاد پر: کیا تیار ہو رہا ہے، متن، آڈیو، یا میڈیا۔ دونوں کی بنیاد پر: مرکب کام جیسے خراب انوائس کی تصویر پڑھ کر اردو میں آواز کا نوٹ تیار کرنا جو تنازع کا خلاصہ ہو۔ دونوں طرف modality جتنی غنی ہوگی، کام اتنا مفید اور اتنا مہنگا ہوگا۔
ماخذ
آگے پڑھنے کے ذرائع۔ Gemini کی multimodal دستاویز، ai.google.dev پر، خاص طور پر بصارت اور دستاویز کی سمجھ کا حصہ۔ OpenAI GPT-5 system card کے vision اور audio حصے۔ Anthropic کی بصارت کی صلاحیتوں کا صفحہ، docs.anthropic.com پر۔ OpenAI کا Whisper مقالہ speech to text کے بنیادی ڈھانچے کے لیے۔ OpenAI Sora کی تکنیکی رپورٹ اور Google Veo کا اعلانیہ صفحہ ویڈیو تخلیق کے لیے۔ پاکستانی پس منظر کے لیے، NADRA کی ٹیکنالوجی بلاگ پر CNIC تصدیق کی خودکار ہونے سے متعلق پوسٹیں، اور پنجاب سیف سٹی اتھارٹی کی سالانہ رپورٹ جو ان کے ابتدائی AI انضمام کے کام کو بیان کرتی ہے۔