图片:The New StackChip Huyen 讲解如何在无需新硬件的情况下降低推理成本 - The New Stack
• 在 10 月 21 日至 22 日参加 P99 CONF 之前,Chip Huyen 分享了降低 AI 推理成本的策略,推理成本是指运行已训练模型以生成预测的相关费用。 • 她建议使用 continuous batching(连续批处理),以防止硬件插槽在等待组中最慢的请求完成时处于闲置状态。 • 这种方法允许开发者同时处理更多请求,从而降低部署 large language models 的公司的单位输出成本。
thenewstack.io



