لاگت کم کرنا — کیشنگ، بیچنگ، روٹنگ
Cost optimisation — caching, batching, routing
38 منٹ
تین طریقے
لیور ایک: پرامپٹ کیشنگ۔ Anthropic اور OpenAI دونوں آپ کو پرامپٹ کے بڑے مستحکم حصوں (لمبا سسٹم پرامپٹ، پالیسی مینوئل، لغت) کو کیشڈ نشان زد کرنے دیتے ہیں۔ پہلی درخواست پوری قیمت ادا کر کے اسے لوڈ کرتی ہے۔ ہر بعد کی درخواست جو کیش دوبارہ استعمال کرے اس حصے کے لیے صرف 10 فیصد دیتی ہے۔ ایک کسٹمر سروس بوٹ جس کا سسٹم پرامپٹ 8000 ٹوکن کا ہو اور ہر کال پر دہرایا جائے، کیشنگ ان پُٹ بل کو تقریباً 70 سے 80 فیصد کم کرتی ہے۔ کیش پانچ منٹ کے لیے زندہ رہتا ہے اور ہر استعمال پر تازہ ہوتا ہے۔ سیٹ اپ API کال میں صرف ایک اضافی پیرامیٹر ہے۔
لیور دو: بیچ API۔ اگر آپ کا کام وقت کا حساس نہیں — رات بھر میں ہزار FBR ریٹرنز کی پروسیسنگ، PIA کی تمام پرواز رپورٹوں کا ماہانہ خلاصہ، سہ ماہی کے آخر پر آڈٹ دستاویزات کا جائزہ — اسے بیچ اینڈ پوائنٹ سے گزاریں۔ Anthropic اور OpenAI دونوں بیچ پروسیسنگ پر 50 فیصد رعایت دیتے ہیں، اور نتائج 24 گھنٹے میں واپس ملتے ہیں۔ رعایت بالکل ایک ہی مواد پر۔ آپ صرف 5 سیکنڈ میں جواب دیکھنے کا حق چھوڑتے ہیں۔ کسی بھی پائپ لائن کے لیے جس کے نتائج اگلی صبح انسان دیکھیں، یہ مفت پیسہ ہے۔
لیور تین: ماڈل روٹنگ۔ ہر سوال کو آپ کے سب سے مہنگے ماڈل کی ضرورت نہیں۔ آسان، ساختی سوالات (درجہ بندی، نکالنا، سادہ سوال جواب) Claude Haiku یا GPT-4o-mini کی طرف بھیجیں جو دسویں حصے کی قیمت لیتے ہیں۔ پیچیدہ سوچ کو Sonnet یا Opus کی طرف صرف اس وقت بھیجیں جب سستا ماڈل ناکام ہو یا اعتماد کا درجہ گرے۔ آپ کے کوڈ میں ایک سادہ if-else یا درخواست سے پہلے ایک چھوٹا روٹر ماڈل 60 سے 70 فیصد ٹریفک کو سستی لین پر منتقل کر سکتا ہے۔ JazzCash اور Easypaisa دونوں اندرونی طور پر اسی وجہ سے اہرامی روٹنگ چلاتے ہیں۔
فوری چیک
فوری چیک: جدید AI روایتی قاعدہ بنیاد پروگرام سے کس طرح مختلف ہے؟
کیوں؟
کیوں کا پہلا درجہ: کیشنگ کیوں چلتی ہے؟ کیونکہ ماڈل پرامپٹ کے کیشڈ حصے کا پہلے سے بنا اندرونی نمائندہ دوبارہ استعمال کر سکتا ہے۔ مہنگا قدم ان ٹوکنوں کی پروسیسنگ ہے؛ سستا قدم پہلے سے پروسیس شدہ نتیجہ استعمال کرنا۔ فروشنے یہ بچت براہ راست منتقل کرتے ہیں کیونکہ ان کا اپنا خرچ بھی کم ہوتا ہے۔
Claude کے ساتھ آزمائیں
AI پرامپٹ: 'یہ میرا موجودہ پرامپٹ ہے: [پیسٹ]۔ یہ روزانہ 1000 بار چلتا ہے۔ اسے اس طرح دوبارہ لکھیں کہ مستحکم حصے کیش بلاک میں جائیں اور بدلتے حصے باہر رہیں۔ cache_control بریک پوائنٹس نشان زد کریں۔ ان پُٹ ٹوکن کی بچت کا فیصد بتائیں۔'
ماخذ
ماخذ اور مزید مطالعہ۔ Anthropic Prompt caching اور Message Batches API دستاویزات۔ OpenAI Prompt caching اور Batch API گائیڈز۔ Anthropic Cookbook میں ماڈلز کے درمیان روٹنگ کی مثال۔ LangChain RouterChain دستاویزات۔ تاخیر بمقابلہ لاگت کے لیے Anthropic انجینئرنگ بلاگ۔