NVIDIA NIM và Inference Microservices: Triển khai AI ở quy mô doanh nghiệp
NIM mang lại thông lượng cao hơn 2,6 lần so với triển khai H100 tiêu chuẩn (1.201 so với 613 token/giây trên Llama 3.1 8B). Cloudera báo cáo tăng hiệu suất 36 lần. NIM 1.4 (tháng 12/2024) đạt tốc độ n...