画像:The New StackChip Huyenが解説する、新しいハードウェアを導入せずに推論コストを削減する方法 - The New Stack
• Chip Huyen氏は、10月21日から22日にかけて開催されるP99 CONFへの登壇を前に、学習済みモデルを実行して予測を生成する際に発生する費用である「AI推論コスト」を削減するための戦略を共有しています。 • 彼女は、グループ内で最も遅いリクエストの完了を待つ間にハードウェアのスロットがアイドル状態になるのを防ぐため、continuous batchingの利用を推奨しています。 • このアプローチにより、開発者はより多くのリクエストを同時に処理できるようになり、大規模言語モデル(LLM)を導入している企業の出力あたりのコストを下げることが可能になります。
thenewstack.io





