이미지: The New StackChip Huyen, 새로운 하드웨어 없이 추론 비용을 절감하는 방법 설명 - The New Stack
• Chip Huyen은 10월 21~22일에 열리는 P99 CONF 출연을 앞두고, 훈련된 모델을 실행하여 예측을 생성하는 데 드는 비용인 AI 추론 비용을 줄이기 위한 전략을 공유하고 있습니다. • 그녀는 그룹 내에서 가장 느린 요청이 완료될 때까지 하드웨어 슬롯이 유휴 상태로 남는 것을 방지하기 위해 continuous batching을 사용할 것을 권장합니다. • 이러한 접근 방식을 통해 개발자는 더 많은 요청을 동시에 처리할 수 있으며, 대규모 언어 모델을 배포하는 기업의 출력당 비용을 낮출 수 있습니다.
thenewstack.io



