Afbeelding: The New StackChip Huyen legt uit hoe inferentiekosten kunnen worden verlaagd zonder nieuwe hardware - The New Stack
• Chip Huyen deelt strategieën om de kosten voor AI-inferentie te verlagen — de uitgaven die gepaard gaan met het draaien van een getraind model om voorspellingen te genereren — voorafgaand aan haar optreden op P99 CONF op 21–22 oktober. • Ze adviseert het gebruik van continuous batching om te voorkomen dat hardware-slots ongebruikt blijven terwijl er wordt gewacht tot het traagste verzoek in een groep is voltooid. • Deze aanpak stelt ontwikkelaars in staat om meer verzoeken gelijktijdig te verwerken, waardoor de kosten per output dalen voor bedrijven die large language models implementeren.
thenewstack.io



