Skip to content

ریٹ لمٹ، تھروٹلنگ، اور پرسکون قطار

Rate limits, throttling, and graceful queueing

33 منٹ

تین طریقے

  1. ریٹ لمٹ وہ زیادہ سے زیادہ تعداد ہے جس تک فروشنا آپ کے اکاؤنٹ سے فی منٹ، فی گھنٹہ، یا فی دن درخواستیں قبول کرے گا۔ Anthropic اور OpenAI انہیں مخصوص صفحات پر شائع کرتے ہیں اور خرچ کے حساب سے درجہ بندی کرتے ہیں: مفت اکاؤنٹ شاید 5 فی منٹ، ادا شدہ 50، اعلیٰ درجہ 500۔ یہ بے ترتیب نہیں؛ یہ اس لیے ہیں کہ فروشنے کے GPU محدود ہیں اور گاہکوں میں انصاف کے لیے حد ضروری ہے۔ یہ نرم وعدہ بھی ہے: آپ سپورٹ کو لکھ کر اور حجم کا اندازہ دکھا کر اکثر اسے بڑھا سکتے ہیں۔

  2. ٹریفک کے جھٹکے جذب کرنے کے تین انداز۔ پہلا، exponential backoff: جب 429 ایرر آئے، 1 سیکنڈ انتظار، دوبارہ کوشش؛ ناکام تو 2 سیکنڈ؛ پھر 4، 8، 60 پر حد۔ زیادہ تر SDKs میں یہ موجود ہے مگر ڈیفالٹ بند۔ آن کریں۔ دوسرا، درخواست قطار: ہر درخواست براہِ راست API پر بھیجنے کے بجائے، اندرونی قطار میں ڈالیں اور ایک ورکر سے قطار کو اس رفتار پر نکالنے دیں جو API برداشت کر لے۔ یہ پیر صبح کا جھٹکا پیر صبح کے گھنٹے میں بدلتا ہے۔ تیسرا، درخواست کی ترجیح: قطار بھری ہو تو فیصلہ کریں کون فوری ہے (فون پر منتظر شہری) اور کون انتظار کر سکتا ہے (رات بھر کا بیچ)۔ گنجائش تنگ ہو تو دوسرے گرائیں یا روکیں۔

  3. دو خاص پاکستانی پیٹرن جن کے لیے ڈیزائن کرنا ضروری ہے۔ پہلا، پیر صبح 9 بجے کا جھٹکا، جہاں ہر ضلع کا ہر افسر ہفتے کے آغاز پر ٹول کھولتا ہے۔ حل: مرحلہ وار شیڈولنگ، 30 منٹ کا گرم ہونے کا وقت جس میں ٹول عام سوالات کے کیشڈ جوابات دیتا ہے، 9 سے 10 بجے کے درمیان ماڈل تک مکمل رسائی بتدریج کھلتی ہے۔ دوسرا، سہ ماہی کے آخر کا جھٹکا، جب کمپلائنس، فنانس، اور آڈٹ ٹیمیں ایک ہی جمعے رپورٹیں بناتی ہیں۔ حل: کیلنڈر سے واقف گنجائش منصوبہ بندی: ہر سہ ماہی کے آخری ہفتے کے لیے فروشنے سے عارضی حد بڑھائیں، پھر گرا دیں۔ فروشنے قابلِ پیش بینی، اچھی طرح بیان کردہ درخواستوں پر ہاں کہتے ہیں۔

فوری چیک

فوری چیک: جدید AI روایتی قاعدہ بنیاد پروگرام سے کس طرح مختلف ہے؟

کیوں؟

کیوں کا پہلا درجہ: فروشنے ریٹ لمٹ کو درجہ وار شائع کیوں کرتے ہیں؟ کیونکہ پیش بینی معماری بنانے دیتی ہے۔ چھپی ہوئی حدوں سے آپ کو حادثات سے پتہ چلتا ہے۔ عوامی حدیں قطار بنانے، backoff لگانے، اور لانچ سے پہلے SLA لکھنے دیتی ہیں۔ اس تحفے کا استعمال کریں۔

Claude کے ساتھ آزمائیں

AI پرامپٹ: 'میں 75 شہروں میں 1000 FBR افسروں کے لیے AI اسسٹنٹ تعینات کر رہا ہوں۔ پیر صبح کا عروج 800 ایک ساتھ صارفین 30 منٹ کے لیے۔ exponential backoff، Redis قطار، اور ترجیحی لینوں کے ساتھ ریٹ لمٹنگ اور قطار کی معماری ڈیزائن کریں۔ ورکر کی تعداد، قطار کی گہرائی کا الرٹ، اور صارف کو دکھنے والا انتظار کا متن انگریزی اور اردو میں دیں۔'

ماخذ

ماخذ اور مزید مطالعہ۔ Anthropic Rate limits۔ OpenAI Rate limits۔ AWS Exponential backoff and jitter۔ Redis قطار کے پیٹرن (Celery، BullMQ، Sidekiq)۔ Google SRE Workbook کے overload اور graceful degradation کے ابواب۔ NIST AI RMF MEASURE فنکشن۔