So sánh các công cụ suy luận trên NVIDIA DGX Spark: Ollama, vLLM và DS4

Nhiều người sẽ cho rằng việc chạy một mô hình lớn lên đến 284 tỷ tham số trên một hệ thống NVIDIA DGX™ Spark duy nhất là điều không thể. Tuy nhiên, trên thực tế, chúng ta hoàn toàn có thể chạy DeepSeek V4 (284B) trên một máy DGX Spark, thay vì phải kết nối hai thiết bị lại với nhau như cách thông thường.

Dù vậy, câu hỏi thực tế và quan trọng hơn mà chúng ta cần đặt ra là: Bạn nên sử dụng công cụ suy luận (inference engine) nào cho mô hình LLM của mình?

Ad
Máy tính AI với siêu chip NVIDIA GB10 Grace Blackwell

Bài viết này sẽ đánh giá và so sánh Ollama, vLLM và DwarfStar (DS4) trên các tiêu chí về chất lượng, tốc độ, khả năng xử lý đồng thời (concurrency) và mức tiêu thụ bộ nhớ, dựa trên các khối lượng công việc thực tế trong quá trình vận hành hạ tầng AI.

Ollama, vLLM và DS4: Đâu là sự lựa chọn phù hợp?

Các bài kiểm tra này được thực hiện nhằm đánh giá các công cụ suy luận dành cho việc chạy các AI agent trên hệ thống Spark. Khuyến nghị này chủ yếu hướng tới người dùng đơn lẻ với thiết lập đa mục đích. Dưới đây là phân loại cơ bản cho ba công cụ:

  • Ollama: Dành cho đa số người dùng. Công cụ này có thể chứa các mô hình lớn hơn, xử lý tốt các yêu cầu tuần tự và chạy gần như mọi thứ bạn yêu cầu. Điểm yếu của Ollama là khả năng chịu tải song song — nhưng nếu bạn là một người dùng chỉ giao tiếp với một mô hình, bạn sẽ hiếm khi cảm nhận thấy hạn chế này.

  • vLLM: Dành cho việc mở rộng quy mô (scale out) và môi trường nhiều người dùng (multi-tenant). Sức mạnh cốt lõi của vLLM là khả năng xử lý đồng thời: hệ thống gom nhóm (batching) nhiều yêu cầu và mở rộng mạnh mẽ khi chịu tải lớn. Điều này có thể không quá rõ rệt với người dùng đơn lẻ, nhưng khi cần triển khai mô hình cho nhiều người dùng, vLLM chắc chắn là lựa chọn tối ưu.

  • DwarfStar (DS4): Đây là công cụ chuyên biệt dành cho một mô hình duy nhất, có khả năng chạy mô hình 284B mà hai công cụ kia không thể xử lý. DS4 cung cấp sức mạnh thô ấn tượng, nhưng chỉ làm được điều đó vì nó được thiết kế để chạy chính xác một mô hình: DeepSeek V4 Flash.

Ollama trên DGX Spark: Công cụ mặc định cho người dùng cá nhân

Đối với một người dùng duy nhất, Ollama là sự lựa chọn mặc định. Việc cài đặt chỉ mất vài phút, có thể chạy hầu như bất kỳ mô hình nào và đáp ứng được các mô hình khổng lồ — bao gồm cả các flagship thuộc lớp 122B mà vLLM không thể tải được trên cỗ máy này.

Điểm mạnh trên DGX Spark:

  • Hỗ trợ các mô hình lớn nhất — lên đến 120–122B trên một thiết bị.

  • Tốc độ luồng đơn (single-stream) nhanh nhất — Gemma-4-26B đạt khoảng ~64 tok/s (token/giây) so với ~30 tok/s trên vLLM.

  • Tốc độ khả dụng ngay cả ở quy mô lớn — 122B đạt khoảng ~25 tok/s, 120B duy trì ở mức ~20 tok/s.

  • Không gặp trở ngại khi cài đặt — thiết lập cực kỳ đơn giản và chạy được đa dạng mô hình.

  • Chất lượng đầu ra tương đương với các công cụ khác.

Điểm yếu trên DGX Spark: Về cơ bản, Ollama xử lý từng yêu cầu một. Việc tinh chỉnh (OLLAMA_NUM_PARALLEL=4 kết hợp q8 KV-cache) có thể tăng tổng thông lượng (throughput) lên khoảng 122 tok/s, nhưng chỉ dừng lại ở đó. Do một người dùng cá nhân hiếm khi gửi hàng chục yêu cầu cùng lúc, yếu điểm về xử lý tuần tự của Ollama thường không gây ảnh hưởng tới công việc thực tế.

(Lưu ý: Sự gia tăng hiệu năng khi tinh chỉnh chỉ áp dụng cho các mô hình kiến trúc MoE – Mixture of Experts. Các mô hình lớn nhất thường bị giới hạn phần cứng do dung lượng bộ nhớ).

vLLM trên DGX Spark: Giải pháp khi cần mở rộng quy mô

Trái ngược với Ollama, vLLM được xây dựng để tối ưu hóa khả năng xử lý đồng thời. Mặc dù tốc độ cho một yêu cầu đơn lẻ khá khiêm tốn (khoảng 30 tok/s đối với Gemma-4-26B), nhưng “siêu năng lực” của nó nằm ở việc xử lý nhóm nhiều yêu cầu cùng lúc.

Điểm mạnh trên DGX Spark:

  • Thông lượng đồng thời tốt nhất — tổng thông lượng vượt qua 300 tok/s ở mức 10+ yêu cầu song song.

  • Là lựa chọn lý tưởng cho các AI agent hoạt động đồng thời hoặc máy chủ phục vụ nhiều người dùng.

  • Phát huy tối đa thế mạnh kiến trúc MoE — Gemma-4-26B đạt được chất lượng tương đương một mô hình 70B với tốc độ gấp nhiều lần.

Điểm yếu trên DGX Spark:

  • Không thể chứa các mô hình quá lớn — một mô hình 122B nguyên khối (monolithic) sẽ dễ dàng chạm ngưỡng giới hạn tải.

  • Cài đặt phức tạp hơn so với Ollama — đòi hỏi một số cờ (flags) cụ thể để Spark hoạt động trơn tru.

DS4: Công cụ chuyên dụng để chạy mô hình 284B trên DGX Spark

DS4 (DwarfStar) là một công cụ đặc thù được xây dựng để chạy duy nhất mô hình DeepSeek V4 Flash ở mức 284 tỷ tham số. Quá trình biên dịch mã nguồn (build from source) diễn ra rất nhanh và có thể tải một phiên bản lượng tử hóa (quantized) khoảng 87 GB, vừa khít với bộ nhớ VRAM của hệ thống.

Điểm mạnh trên DGX Spark:

  • Cho chất lượng phản hồi cao nhất trong số các mô hình được kiểm tra.

  • Thời gian triển khai nhanh chóng.

  • Đạt tốc độ giải mã ~15 tok/s — hoàn toàn khả dụng cho các tương tác cá nhân.

Điểm yếu trên DGX Spark:

  • Thiếu tính linh hoạt — chỉ chạy được DeepSeek V4 Flash.

  • Không hỗ trợ gom nhóm (batching) — phục vụ duy nhất một người dùng.

  • Dung lượng context bị giới hạn (do mô hình đã chiếm dụng gần hết RAM).

Cách giữ cho DGX Spark hoạt động ổn định và không bị treo

Khi khai thác tài nguyên phần cứng, hệ thống DGX Spark có thể bị treo (cần rút phích cắm khởi động lại) nếu bạn cố tải một mô hình vượt quá giới hạn bộ nhớ.

Để khắc phục, bộ nhớ hợp nhất của Spark cần giữ lại một không gian trống (headroom) cho hệ điều hành và các dịch vụ nền. Giải pháp thiết thực là sử dụng công cụ theo dõi bộ nhớ (memory watchdog) để can thiệp trước khi chạm ngưỡng, kết hợp với việc đặt giới hạn bộ nhớ cứng (hard cap) cho từng container. Khi đó, kernel của hệ thống sẽ chủ động ngắt tiến trình lỗi thay vì làm sập toàn bộ thiết bị.

Lựa chọn mô hình nào cho hệ thống AI agent của bạn?

Nếu bạn đang tìm kiếm một mô hình cho AI agent với khả năng gọi công cụ (tool-calling) chính xác, dung lượng context thực tế rộng và tốc độ ổn định, dưới đây là những lựa chọn đáng cân nhắc:

  • Các mô hình lớn (70B–284B): Thông minh nhất, nhưng phản hồi chậm (~6–25 tok/s) và tiêu tốn nhiều bộ nhớ.

  • Các mô hình tầm trung kiến trúc MoE (~26–34B): Điểm cân bằng hoàn hảo. Chúng cung cấp tốc độ xử lý nhanh (~30–75 tok/s), thông minh và tiết kiệm tài nguyên.

  • Các mô hình nhỏ (≤13B): Nhanh nhất (hơn 80 tok/s), nhưng năng lực suy luận và lập luận kém hơn hẳn.

Các lựa chọn khuyên dùng:

  • Qwen3.5-122B (MoE): Chất lượng đỉnh cao, tương thích tốt với Ollama, có context 64K và hoạt động trơn tru với script/công cụ.

  • Gemma-4-26B (MoE): Nhanh, đáp ứng tốt việc gọi công cụ và xử lý cực kỳ hiệu quả.

  • Qwen3-Coder-80B (MoE): Đặc biệt mạnh trong việc tạo mã (coding) hoặc sử dụng các công cụ phức tạp.

  • Nemotron-120B (Mamba MoE): Chất lượng tuyệt vời, hoạt động tốt khi gom nhóm trên vLLM và cung cấp tốc độ đơn luồng ấn tượng nếu được cấu hình đúng.

Một số câu hỏi thường gặp về DGX Spark và các công cụ suy luận

Mô hình lớn nhất có thể chạy trên NVIDIA DGX Spark là gì? Hệ thống này có thể vận hành thoải mái các mô hình từ 120–122B tham số (qua Ollama), và chạm mốc 284B với DeepSeek V4 Flash (qua DS4). Giới hạn cốt lõi nằm ở bộ nhớ hợp nhất chứ không phải năng lực tính toán thô.

Nên chọn vLLM hay Ollama trên DGX Spark? Đối với người dùng đơn lẻ, hãy chọn Ollama để có tốc độ luồng đơn nhanh và tương thích nhiều mô hình khổng lồ. Nếu cần phục vụ nhiều yêu cầu đồng thời hoặc các AI agent xử lý song song, vLLM chính là câu trả lời.

DGX Spark đạt được bao nhiêu token mỗi giây? Tốc độ phụ thuộc nhiều vào số lượng tham số được kích hoạt của mô hình do hệ thống bị giới hạn bởi băng thông bộ nhớ. Mô hình MoE 26B đạt ~30–64 tok/s, mô hình MoE lớp 120B đạt ~15–26 tok/s, trong khi mô hình dày đặc (dense) 70B chỉ đạt ~6 tok/s.

Kết luận: Khi nào nên sử dụng công cụ và mô hình nào?

Tóm lại, để khai thác tốt nhất hệ thống phần cứng của bạn, hãy áp dụng nguyên tắc:

  1. Dành cho người dùng cá nhân: Ưu tiên sử dụng Ollama kết hợp với mô hình kiến trúc MoE.

  2. Dành cho môi trường doanh nghiệp đa người dùng hoặc AI agent song song: Lựa chọn vLLM làm nền tảng.

  3. Yêu cầu sức mạnh thô lớn nhất ở một mô hình: Thử sức với DS4.

Bài học quan trọng nhất là trên các cỗ máy như DGX Spark, bộ nhớ quyết định mọi thứ. Cách công cụ quản lý tài nguyên, cũng như số lượng tham số mà mô hình kích hoạt cho mỗi token, sẽ tạo ra sự khác biệt lớn nhất về hiệu suất.

Với tư cách là đối tác cấp Elite của NVIDIA Partner Network, Nhất Tiến Chung (NTC AI) tự hào cung cấp các giải pháp tối ưu và sẵn sàng tư vấn chuyên sâu về hạ tầng AI, từ cấp độ phòng lab đến AI Factory, cũng như các nền tảng tiên tiến bậc nhất hiện nay như NVIDIA DGX, DGX GB300, DGX B300 hay hệ thống SuperPOD. Hãy liên hệ với chuyên gia của NTC AI để thiết kế một hệ thống tối ưu nhất cho hành trình phát triển Trí tuệ Nhân tạo của doanh nghiệp bạn.

____
Bài viết liên quan

TAG: , ,