xAI's Memphis Colossus: Giải phẫu một siêu máy tính 100.000 GPU
xAI xây dựng cụm Colossus 100.000 GPU trong 122 ngày, nhân đôi lên 200K trong 92 ngày tiếp theo. Công suất 250MW, Ethernet Spectrum-X. Bên trong siêu máy tính AI lớn nhất thế giới.
Thông tin chuyên sâu về hạ tầng GPU, AI và trung tâm dữ liệu.
xAI xây dựng cụm Colossus 100.000 GPU trong 122 ngày, nhân đôi lên 200K trong 92 ngày tiếp theo. Công suất 250MW, Ethernet Spectrum-X. Bên trong siêu máy tính AI lớn nhất thế giới.
800G thống trị thị phần switch trong các cụm AI năm 2025. Doanh thu mạng của NVIDIA tăng gấp đôi lên 7,3 tỷ USD. Lập kế hoạch chuyển đổi từ 400G lên 800G và xa hơn nữa.
OpenAI đã chọn CoreWeave thay vì AWS với hợp đồng cơ sở hạ tầng trị giá 22,4 tỷ USD. Tìm hiểu cách công ty đào tiền mã hóa này trở thành nền tảng GPU cloud đang vận hành sự phát triển AI tiên tiến.
Di chuyển GPU làm mát bằng chất lỏng làm tăng độ phức tạp—xả dung dịch làm mát, ngắt kết nối manifold, kiểm tra rò rỉ tại địa điểm mới. Khôi phục huấn luyện dựa trên checkpoint đang cải thiện với các ...
Một lần tạo video 10 giây tiêu thụ tài nguyên GPU tương đương hàng nghìn truy vấn ChatGPT—chi phí tính toán thực tế từ $0.50-$2.00. Open-Sora 2.0 thể hiện khả năng đẳng cấp thế giới với $200K so với M...
NVIDIA công bố PCF của H100 ở mức 1.312 kg CO2e mỗi baseboard 8 card (164 kg/card). Nghiên cứu của Cornell dự báo 24-44 triệu tấn CO2 hàng năm từ AI vào năm 2030. Phát thải của Amazon tăng lên 68,25 t...
Hướng dẫn triển khai CXL 4.0 toàn diện bao gồm bundled ports, memory pooling đa rack, KV cache offloading, hệ sinh thái nhà cung cấp và lộ trình quy hoạch 2026-2027.
Thị trường học liên hợp đạt 0,1 tỷ USD năm 2025, dự kiến 1,6 tỷ USD vào năm 2035 (CAGR 27%). Các doanh nghiệp lớn chiếm 63,7% thị phần cho hợp tác xuyên silo. Chỉ 5,2% nghiên cứu đã đạt đến triển khai...
MLflow 3.0 mở rộng registry cho AI tạo sinh và AI agent—kết nối mô hình với phiên bản mã nguồn, prompt, kết quả đánh giá và metadata triển khai. Quản lý phiên bản mô hình giờ đây không chỉ theo dõi tr...
NVIDIA DCGM 3.3+ bổ sung hỗ trợ GPU Blackwell và giám sát MIG nâng cao. Các nền tảng AIOps (Datadog, Dynatrace, New Relic) tích hợp các chỉ số GPU gốc. Run:ai, Determined AI cung cấp tối ưu hóa sử dụn...
InfiniBand mang lại hiệu suất cao hơn 15% nhưng chi phí gấp 2,3 lần so với Ethernet. Tìm hiểu cách Meta, OpenAI và Google đã lựa chọn kiến trúc mạng trị giá 50 triệu đô la của họ.
GB200 NVL72 với 120kW/rack hiện đã xuất xưởng—con số 2.4MW là mục tiêu cho các cấu hình tương lai. Vera Rubin NVL144 hướng tới 600kW mỗi rack vào năm 2026. Làm mát bằng chất lỏng (trực tiếp đến chip c...
Hãy cho chúng tôi biết về dự án của bạn và chúng tôi sẽ phản hồi trong vòng 72 giờ.
Cảm ơn bạn đã gửi yêu cầu. Đội ngũ của chúng tôi sẽ xem xét và phản hồi trong vòng 72 giờ.