Năng lượng là yếu tố hạn chế không thể tránh khỏi đối với cơ sở hạ tầng AI. Số lượng token mà một nhà máy AI có thể tạo ra trong một ngân sách năng lượng cố định sẽ quyết định doanh thu và lợi nhuận của nó. Vì lý do này, hiệu suất trên mỗi watt — một chỉ số không thể bị thao túng, chỉ có thể đạt được thông qua kết quả thực tế — là nền tảng cho các nhà máy AI.
Khi trí tuệ nhân tạo (AI) thúc đẩy nhu cầu về token tăng cao, các quyết định về cơ sở hạ tầng mà các tổ chức đưa ra ngày hôm nay sẽ quyết định ai có thể mở rộng quy mô và ai không trong một thế giới hạn chế về năng lượng.
Hầu hết các mô hình AI tiên tiến hiện nay đều hoạt động trên kiến trúc kết hợp nhiều chuyên gia (MoE). Để vận hành hiệu quả các mô hình quy mô lớn này, kích thước miền GPU — số lượng GPU được kết nối qua một đường truyền siêu nhanh, có khả năng mở rộng — rất quan trọng, và càng lớn càng tốt.
Mặc dù thế hệ NVIDIA Hopper đã thiết lập tiêu chuẩn với một hệ thống tám GPU, nhưng quy mô của trí tuệ nhân tạo tiên tiến hiện nay đã vượt xa tiêu chuẩn đó. Việc phục vụ Bộ Năng lượng với một hệ thống 72 GPU đòi hỏi thiết kế đồng bộ toàn diện và chiều sâu vận hành có được từ việc chạy các mô hình này dưới tải sản xuất thực tế.
Với nền tảng NVIDIA Blackwell NVL72 , nền tảng đó đã được xây dựng và chứng minh, mang lại hiệu năng cao nhất trên mỗi watt để tối đa hóa doanh thu và chi phí token thấp nhất để tối đa hóa lợi nhuận. Chính nền tảng này là cơ sở để nền tảng NVIDIA Vera Rubin tiếp tục nâng cao hiệu quả năng lượng ở quy mô rack.
Tối ưu hóa hiệu năng trên mỗi watt cho Frontier AI
Mỗi thế hệ mô hình tiên tiến mới đều mang đến những thay đổi về kiến trúc, mở khóa khả năng thông minh cao hơn đồng thời đòi hỏi những tối ưu hóa mới để hoạt động hiệu quả ở quy mô lớn.
Trên thế hệ mới nhất của các mô hình mở hàng đầu, NVIDIA GB300 NVL72 mang lại hiệu năng trên mỗi watt cao hơn tới 25 lần so với thế hệ NVIDIA Hopper — cho thấy hiệu năng MoE được cải thiện khi chuyển từ kích thước miền 8 GPU sang 72 GPU. Những con số này phản ánh vị thế hiện tại của Blackwell, một điểm khởi đầu tiếp tục được cải thiện.
Bất kỳ con số đơn lẻ nào cũng chỉ nói lên một phần câu chuyện. Các khối lượng công việc khác nhau đòi hỏi các điểm vận hành khác nhau: một số tối ưu hóa cho độ trễ, một số khác cho thông lượng và chi phí — và hầu hết cần phải chuyển đổi giữa hai yếu tố này.
Để thể hiện tốt nhất các điểm hoạt động này, NVIDIA hiển thị các đường cong Pareto cho từng mô hình thay vì một điểm duy nhất và cung cấp các công cụ như DynoSim để giúp các nhóm tìm ra điểm tối ưu của họ trên đường biên Pareto trước khi dành bất kỳ giờ GPU nào cho việc xác thực.
Hệ thống NVIDIA GB300 NVL72 mang lại hiệu năng trên mỗi watt cao hơn tới 25 lần so với NVIDIA Hopper trên DeepSeek V4 Pro. Nguồn: SemiAnalysis InferenceXTrên hệ thống GLM5.1 NVIDIA GB300 NVL72, hiệu năng trên mỗi watt đạt được cao hơn tới 20 lần so với NVIDIA Hopper. Nguồn: SemiAnalysis InferenceXHệ thống NVIDIA GB300 NVL72 mang lại hiệu năng trên mỗi watt cao hơn tới 10 lần so với NVIDIA Hopper cho Kimi K2.6, một mô hình được thiết kế đặc biệt cho các tác vụ tác nhân tầm xa. Nguồn: SemiAnalysis InferenceX
Hiệu năng trên mỗi watt mà NVIDIA Blackwell mang lại là kết quả của quá trình thiết kế đồng bộ cực kỳ tỉ mỉ: mọi thành phần của hệ thống quy mô rack, từ silicon đến phần mềm , đều được thiết kế cùng nhau để tối đa hóa thông lượng token cho các tác vụ suy luận AI. Quá trình thiết kế đồng bộ đó tác động đến mọi lớp của kiến trúc.
Ví dụ, NVIDIA NVLink Switch , rất quan trọng đối với hiệu năng quy mô rack, được thiết kế chuyên dụng để khai thác tối đa khả năng mở rộng quy mô GPU, chứ không phải được cải tiến từ mạng đa năng. Hiện nay, ở thế hệ thứ sáu với nền tảng Vera Rubin, các khả năng của nó được thiết kế đặc biệt cho các tác vụ AI như SHARP, thực hiện tính toán trong mạng trực tiếp trên switch, giảm tải công việc cho chính các GPU.
Bộ phần mềm suy luận của NVIDIA , bao gồm NVIDIA Dynamo và TensorRT LLM, cũng như SGLang và vLLM, được xây dựng để chạy đầy đủ các tối ưu hóa: lượng tử hóa NVFP4, phân tách phục vụ, song song hóa chuyên gia quy mô lớn, định tuyến nhận biết KV, giảm tải bộ nhớ cache KV và hơn thế nữa. Chúng kết hợp với nhau để nhân hiệu năng mà mỗi GPU mang lại. Hơn nữa, phần mềm tiếp tục cải thiện hiệu năng theo thời gian: Trên DeepSeek V4, hiệu năng trên mỗi watt đã được cải thiện lên đến 5 lần chỉ trong một tháng.
Trong các nhà máy AI, lượng điện năng bị thất thoát do hệ thống làm mát và sự kém hiệu quả ở cấp độ giá đỡ có thể khiến chỉ khoảng 60% lượng điện năng lấy từ lưới điện được sử dụng hiệu quả cho công việc AI. NVIDIA DSX MaxLPS, phần mềm quản lý điện năng và hiệu quả trong nền tảng NVIDIA DSX , giúp khắc phục khoảng cách này bằng cách chuyển đổi điện năng giữa các GPU và giá đỡ trong thời gian thực, hỗ trợ làm mát bằng chất lỏng ấm và sử dụng các kỹ thuật như điều khiển điện năng để tối ưu hóa hiệu suất. Điều này cho phép người vận hành chạy nhiều hơn tới 40% GPU trong cùng một ngân sách điện năng.
Production mới là yếu tố quan trọng.
Việc đạt được độ tin cậy ở quy mô tủ rack trong nhà máy AI là điều khó khăn. Các hệ thống quy mô tủ rack dễ phát sinh các chế độ lỗi mà các hệ thống đơn nút không bao giờ gặp phải, và việc xử lý chúng đòi hỏi sự chặt chẽ về kỹ thuật và thời gian trong quá trình production.
Hệ thống NVIDIA Blackwell NVL72 tiếp tục thiết lập tiêu chuẩn trên nhiều mô hình và trường hợp sử dụng thực tế khác nhau, mang lại hiệu năng ổn định, độ tin cậy ở cấp độ rack và tính kinh tế được duy trì ngay cả trong điều kiện lưu lượng truy cập thực tế hàng ngày.
Đó là lý do tại sao các phòng thí nghiệm AI hàng đầu như Anthropic, OpenAI và SpaceXAI sử dụng hệ thống NVIDIA Blackwell NVL72 để thực hiện suy luận.
Ngoài ra, nhiều nhà cung cấp dịch vụ suy luận và các chuyên gia AI sử dụng nền tảng Blackwell để triển khai các mô hình mã nguồn mở trong môi trường production.
CoreWeave đã triển khai Kimi K2.6 trên NVIDIA GB300 NVL72, kết hợp lượng tử hóa NVFP4 và giải mã dự đoán EAGLE3 để tối đa hóa hiệu suất suy luận.
Perplexity sử dụng Qwen3 235B và Qwen3.5-397B-A17B đã được huấn luyện sau đó trên NVIDIA GB200 NVL72 cho nền tảng tác nhân AI của mình, xử lý hàng triệu truy vấn mỗi ngày với độ trễ và độ tin cậy mà người dùng cần.
Fireworks AI triển khai GLM 5.2 trên nền tảng NVIDIA Blackwell, cho phép triển khai sản phẩm cho các khách hàng bao gồm Cursor và Factory AI.
Kinh nghiệm trong môi trường production tích lũy được qua nhiều thế hệ mô hình tiên tiến và triển khai thực tế chính là điều mang lại lợi thế vượt trội cho NVIDIA Vera Rubin.
Bài viết liên quan
