छवि: The New StackChip Huyen ने बताया कि नए हार्डवेयर के बिना इन्फरेंस लागत (inference costs) को कैसे कम किया जाए - The New Stack
• Chip Huyen 21-22 अक्टूबर को होने वाले अपने P99 CONF उपस्थिति से पहले AI इन्फरेंस लागत को कम करने की रणनीतियाँ साझा कर रही हैं, जो भविष्यवाणियाँ उत्पन्न करने के लिए प्रशिक्षित मॉडल चलाने से जुड़े खर्च होते हैं। • वह 'continuous batching' के उपयोग की सलाह देती हैं ताकि किसी समूह के सबसे धीमे अनुरोध के पूरा होने का इंतज़ार करते समय हार्डवेयर स्लॉट खाली न रहें। • यह दृष्टिकोण डेवलपर्स को एक साथ अधिक अनुरोधों को प्रोसेस करने की अनुमति देता है, जिससे लार्ज लैंग्वेज मॉडल्स (large language models) तैनात करने वाली कंपनियों के लिए प्रति आउटपुट लागत कम हो जाती है।
thenewstack.io





