Gambar: The New StackChip Huyen menjelaskan cara memangkas biaya inferensi tanpa perangkat keras baru - The New Stack
• Chip Huyen berbagi strategi untuk mengurangi biaya inferensi AI, yaitu biaya yang terkait dengan menjalankan model yang telah dilatih untuk menghasilkan prediksi, menjelang penampilannya di P99 CONF pada 21–22 Oktober. • Ia merekomendasikan penggunaan continuous batching untuk mencegah slot perangkat keras menganggur saat menunggu permintaan terlambat dalam satu grup selesai. • Pendekatan ini memungkinkan pengembang untuk memproses lebih banyak permintaan secara bersamaan, sehingga menurunkan biaya per output bagi perusahaan yang menerapkan large language models.
thenewstack.io



