圖片:The New StackChip Huyen 解釋如何在無需新硬體的情況下降低推論成本 - The New Stack
• Chip Huyen 在 10 月 21-22 日出席 P99 CONF 之前,分享了降低 AI 推論成本(即運行已訓練模型以生成預測相關的費用)的策略。 • 她建議使用連續批處理(continuous batching),以防止硬體插槽在等待一組請求中最慢的請求完成時處於閒置狀態。 • 這種方法允許開發者同時處理更多請求,從而降低部署大型語言模型公司的單位輸出成本。
thenewstack.io





