Image : The New StackChip Huyen explique comment réduire les coûts d'inférence sans nouveau matériel - The New Stack
• Chip Huyen partage des stratégies pour réduire les coûts d'inférence de l'IA, à savoir les dépenses associées à l'exécution d'un modèle entraîné pour générer des prédictions, avant son intervention à la P99 CONF les 21 et 22 octobre. • Elle recommande l'utilisation du continuous batching pour éviter que les slots matériels ne restent inactifs en attendant que la requête la plus lente d'un groupe se termine. • Cette approche permet aux développeurs de traiter plus de requêtes simultanément, abaissant ainsi le coût par résultat pour les entreprises déployant des large language models.
thenewstack.io





