Imagem: The New StackChip Huyen explica como reduzir custos de inferência sem novo hardware - The New Stack
• Chip Huyen está compartilhando estratégias para reduzir os custos de inferência de IA, que são as despesas associadas à execução de um modelo treinado para gerar previsões, antes de sua participação na P99 CONF em 21 e 22 de outubro. • Ela recomenda o uso de continuous batching para evitar que os slots de hardware fiquem ociosos enquanto aguardam a conclusão da requisição mais lenta de um grupo. • Essa abordagem permite que os desenvolvedores processem mais requisições simultaneamente, diminuindo o custo por saída para as empresas que implementam large language models.
thenewstack.io






