Các tác nhân AI đang học cách làm được nhiều hơn bằng cách làm việc cùng nhau. Một tác nhân dẫn đầu có thể chia một nhiệm vụ phức tạp thành các công việc nhỏ hơn và phân công những công việc đó cho các tác nhân phụ chuyên biệt. Ngoài ra, người dùng bắt đầu chạy nhiều phiên tác nhân cùng một lúc. Các quy trình làm việc đa tác nhân để hoàn thành các nhiệm vụ phức tạp cũng ngày càng trở nên phổ biến.
Cách tiếp cận theo chiều rộng này có thể cải thiện tốc độ hoàn thành nhiệm vụ và nâng cao chất lượng phản hồi, nhưng nó cũng có thể gây ra nút thắt cho hệ thống khi nhiều yêu cầu được gửi đến GPU cùng một lúc.
NVIDIA Personal AI Router (PAIR) tận dụng phần cứng tại chỗ của bạn để giảm bớt nút cổ chai đa tác tử và tác tử phụ. PAIR định tuyến từng yêu cầu suy luận độc lập đến một hệ thống khả dụng trên mạng gia đình. Nó hoạt động với các dịch vụ suy luận tại chỗ quen thuộc, bao gồm Ollama và LM Studio, cho phép người dùng mở rộng khả năng tính toán sẵn có cho một tác tử mà không cần thiết kế lại chính tác tử đó. Không cần thay đổi đối với khung điều khiển tác tử.
Bản beta của NVIDIA PAIR có sẵn cho các hệ thống Windows, macOS và Linux được hỗ trợ thông qua giao diện đồ họa và giao diện dòng lệnh. Nó hỗ trợ các hệ thống tương thích với GPU NVIDIA GeForce RTX 20 Series và các thế hệ mới hơn, GPU NVIDIA RTX PRO workstation (kiến trúc Turing và mới hơn), cũng như NVIDIA DGX Spark và silicon Apple M4+.
Ad
NVIDIA PAIR là gì?
NVIDIA PAIR là một bộ định tuyến suy luận ảo, giúp tối đa hóa khả năng tính toán AI trong ngôi nhà của bạn. Đây không phải là một công cụ suy luận mới. Ollama hoặc LM Studio vẫn sẽ chạy mô hình trên một máy được chọn. PAIR phát hiện các hệ thống tham gia, theo dõi xem mỗi hệ thống có sẵn sàng cho một yêu cầu hay không, lên lịch các công việc độc lập và trả lại mỗi phản hồi cho ứng dụng đã khởi tạo nó.
Các tác nhân có thể gửi yêu cầu thông qua giao diện cục bộ quen thuộc mà nó mong đợi. PAIR nhận yêu cầu thông qua proxy của nó, xác định yêu cầu về công cụ và mô hình của nó, và chọn một nút đủ điều kiện. Nút đó thực thi yêu cầu từ đầu đến cuối và gửi phản hồi trở lại thông qua PAIR. Tác nhân tiếp tục thấy một kết nối trong khi PAIR xử lý việc định vị phía sau nó. Các tính năng bao gồm:
- Không có API mới: PAIR trung gian tương thích với các giao diện Ollama và LM Studio thay vì yêu cầu mọi khung điều khiển tác nhân tích hợp với một API cụm mới.
- Khách hàng đàn hồi: Các hệ thống tương thích có thể đóng góp dung lượng khi có sẵn và rút lui khi cần thiết, chẳng hạn như tắt nguồn hoặc đưa hệ thống vào chế độ ngủ.
- Điều khiển cục bộ: PAIR được thiết kế để giữ các yêu cầu đầu vào, dữ liệu và lưu lượng suy luận trên mạng cục bộ hiện có của người dùng.

PAIR giải quyết vấn đề suy luận cục bộ đa tác nhân như thế nào?
Xét một nhà sản xuất-tiêu dùng AI đang chạy một tác nhân cục bộ trên máy tính cá nhân NVIDIA RTX AI chính. Tác nhân này nhận một nhiệm vụ nghiên cứu, lập trình hoặc tổ chức cá nhân và chia nhỏ nó thành nhiều tác nhân phụ. Mỗi tác nhân công việc khám phá một phần giới hạn của vấn đề trong khi các tác nhân khác xác minh bằng chứng hoặc lắp ráp kết quả.
Từ góc nhìn của người dùng, đây là một tác vụ duy nhất. Tuy nhiên, ở tầng suy luận (inference layer), nó có thể trở thành hàng chục cuộc gọi mô hình độc lập. Nếu mỗi cuộc gọi đều nhắm đến một động cơ cục bộ, chúng sẽ cạnh tranh cùng các khe thực thi. Hàng đợi sẽ tăng lên, và máy tính cá nhân chính vẫn bị chiếm dụng mặc dù một máy trạm RTX PRO, laptop hoặc DGX Spark ở đâu đó trên mạng có thể đang có sẵn dung lượng tương thích.
PAIR cho phép tầng suy luận mở rộng cùng với tác tử (agent). Một số yêu cầu của tiểu tác tử (subagent) có thể chạy trên máy tính cá nhân chính, trong khi những yêu cầu khác chạy trên các nút được ghép nối bổ sung. Khi khối lượng công việc có đủ các tác vụ độc lập, việc sử dụng nhiều hệ thống sẵn sàng hơn có thể giảm thời gian chờ đợi và cải thiện thời gian hoàn thành tổng thể.
Nó có thể giữ cho máy tính chính tập trung vào các trò chơi đòi hỏi đồ họa nặng, sáng tạo nội dung hoặc các công việc tương tác khác trong khi phân phối suy luận đến các nút khác.
Đây là độ đồng thời ở mức công việc. PAIR không khiến một yêu cầu suy luận chạy trên nhiều GPU. Mỗi yêu cầu được gán cho một nút đủ điều kiện và vẫn ở đó trong suốt vòng đời của nó.
Tận dụng tính đàn hồi của các cụm AI tại nhà
Một cụm AI tại nhà không phải là một trung tâm dữ liệu thu nhỏ. Các cụm chuyên dụng thường được xây dựng xung quanh các hệ thống luôn được cấp nguồn, có cấu hình ổn định và luôn sẵn sàng hoạt động. Phần cứng tại nhà có tính động cao. Một máy tính chơi game có thể trở nên bận rộn khi đang chơi game. Một máy tính xách tay có thể ngủ, tắt hoặc rời khỏi mạng. Một máy trạm có thể có mô hình được yêu cầu trong khi một máy khác thì không. Một công cụ suy luận có thể bị dừng lại, hoặc người dùng có thể thu hồi GPU cho một ứng dụng chạy nền trước.
PAIR được thiết kế để phù hợp với những điều kiện thay đổi đó. Nó có thể phát hiện các hệ thống cục bộ bằng mDNS, ghép nối các thiết bị được hỗ trợ trên mạng riêng và duy trì cái nhìn trực tiếp về các nút có thể nhận công việc mới. Các nút khách có thể tham gia vào nhóm tài nguyên sẵn có khi sẵn sàng và rời đi khi cần thiết mà không cần biến ngôi nhà thành một cơ sở suy luận chuyên dụng, luôn hoạt động.
Đối với mỗi yêu cầu mới, PAIR xem xét nhiều yếu tố khác nhau, bao gồm:
- Dù một nút được ghép nối có trực tuyến và sẵn sàng hay không
- Dù một công cụ suy luận được hỗ trợ có được bật hay không
- Cho dù mô hình được yêu cầu chính xác có tồn tại hay không
- Tải trọng công việc của nút và động cơ hiện tại, bao gồm các tác vụ đang hoạt động
- Mức sử dụng GPU hiện tại (dù có ứng dụng hoặc công cụ nào đang chạy yêu cầu đồ họa hay không)
PAIR không phụ thuộc vào việc mọi hệ thống phải giống hệt nhau hoặc luôn sẵn sàng. Nó lên lịch các yêu cầu suy luận và quản lý cụm máy dựa trên cách các hệ thống được sử dụng trong cuộc sống hàng ngày.
Demo: Kịch bản năm phụ tác tử Hermes
Bài trình diễn này sử dụng PAIR kết hợp với Hermes Desktop để tạo tải công việc cho các phụ tác tử, và Ollama để thực thi mô hình trên mỗi nút đã chọn. Nhiệm vụ yêu cầu Hermes phân tích một hộp thư đến tổng hợp của hộ gia đình và tạo ra một kế hoạch “Reset Chủ Nhật” đáng tin cậy—những việc cần làm vào tối nay, trong tuần này, sau đó, hoặc không làm gì cả—kèm theo bằng chứng cho mỗi kết luận cụ thể.
Đối với lần chạy gồm năm tác tử phụ, Hermes tạo ra năm chuyên gia để xem xét các phần độc lập của bằng chứng, giải quyết các xung đột và trả về một kế hoạch tổng hợp. Hermes chịu trách nhiệm phân rã, ủy quyền và tổng hợp. PAIR chịu trách định tuyến suy luận. Ollama thực thi từng yêu cầu trên nút mà PAIR chọn.
Sử dụng Qwen 3.6 35B A3B trên một máy tính xách tay NVIDIA RTX Spark, cùng một khối lượng công việc gồm năm tác tử phụ mất trung bình 18 phút để hoàn thành. So sánh với đó, một cụm PAIR gồm ba thiết bị, bao gồm một máy tính xách tay RTX Spark, một DGX Spark và một RTX 5090, mất trung bình 8 phút 48 giây để hoàn thành. Lưu ý rằng đây là một bản demo không chính thức, chỉ dành cho cấu hình cụ thể, không phải là một bài kiểm tra hiệu năng tổng quát hay lời hứa về khả năng mở rộng tuyến tính.

Bản trình diễn không chính thức, phụ thuộc vào cấu hình cụ thể. Kết quả phụ thuộc vào tính song song của tác vụ, mô hình, cài đặt công cụ, phần cứng, mạng và khả năng sẵn có của các nút. Đây không phải là một bài kiểm tra hiệu năng phổ quát.
Chế độ xem Jobs trong PAIR là nguồn dữ liệu chính xác để xác định vị trí chạy suy luận. Số lượng tác nhân Hermes và số lượng công việc PAIR là các phép đo khác nhau vì một tác nhân có thể tạo ra nhiều yêu cầu mô hình. Việc thực thi đa nút chỉ nên được báo cáo khi telemetry của PAIR cho thấy các công việc đang chạy trên nhiều hơn một nút đủ điều kiện.
NVIDIA PAIR hoạt động như thế nào?
Phần này cung cấp giải thích chi tiết từng bước về cách NVIDIA PAIR hoạt động.
Sử dụng tính năng phát hiện mạng cục bộ để tìm các hệ thống lân cận
Sau khi PAIR được cài đặt trên mỗi hệ thống Windows, macOS hoặc Linux tương thích, nó sử dụng tính năng khám phá mạng cục bộ (mDNS) để tự động tìm các hệ thống lân cận. Một nút cũng có thể được thêm vào bằng địa chỉ IP khi cần thiết. Người dùng phê duyệt yêu cầu ghép nối bảo mật để tạo tập hợp các nút cục bộ đáng tin cậy mà PAIR có thể xem xét.
Tất cả giao tiếp giữa các nút bị chặn cho đến khi kết nối bảo mật và quá trình ghép nối được thiết lập. Sau khi kết nối được thiết lập, các giao tiếp được bảo mật bằng MTLS và các chứng chỉ được tạo ra, đảm bảo rằng các giao tiếp giữa các nút vẫn riêng tư trên mạng.
Chuẩn bị các công cụ suy luận và mô hình
Mỗi nút tham gia chạy một công cụ suy luận cục bộ được hỗ trợ: Ollama hoặc LM Studio. PAIR có thể giúp cài đặt công cụ và khởi tạo tải xuống mô hình trên các hệ thống được ghép cặp, giúp giảm bớt công việc cần thiết để chuẩn bị nhiều máy. Một nút chỉ đủ điều kiện cho một yêu cầu khi công cụ yêu cầu đã được bật và mô hình chính xác được yêu cầu có sẵn tại đó.
Tuy nhiên, các mô hình không cần phải giống nhau trên mỗi nút trong cụm. Các hệ thống khác nhau có thể lưu trữ các mô hình khác nhau, và PAIR có thể định tuyến theo vị trí của mô hình. Việc tải cùng một thẻ mô hình trên nhiều nút chỉ đơn giản là cung cấp cho bộ lập lịch một tập hợp các nút đủ điều kiện lớn hơn cho yêu cầu đó.
Chuyển tiếp giao diện cục bộ tương thích
Một ứng dụng tương thích gửi yêu cầu tương thích với Ollama hoặc LM Studio thông qua điểm cuối cục bộ được PAIR chuyển tiếp. Các khung điều khiển tác nhân (agent harness) có thể tiếp tục sử dụng giao diện mà chúng đã quen thuộc thay vì phải tự phát hiện và tích hợp với từng máy một cách độc lập. Các ứng dụng cung cấp URL cơ sở có thể cấu hình được sẽ tiếp tục trỏ đến các điểm cuối tương ứng của Ollama hoặc LM Studio.
PAIR chuyển tiếp yêu cầu bằng cách chiếm quyền điều khiển cổng mặc định mà Ollama và LM Studio sử dụng cho các dịch vụ của chúng. Nếu bộ khung tác nhân (agent harness) đang sử dụng một cổng khác, cổng proxy có thể được cấu hình trong cài đặt của động cơ PAIR.
PAIR kiểm tra các yêu cầu về động cơ và mô hình của yêu cầu, sau đó chuyển những yêu cầu đó đến bộ định tuyến. Sự tách biệt này là trung tâm của thiết kế: tác nhân quyết định công việc nào cần yêu cầu, trong khi PAIR quyết định nơi công việc đủ điều kiện sẽ được thực thi.

Lên lịch cho một nút đủ điều kiện
Bộ lập lịch lọc các hệ thống đã ghép đôi bằng cách sử dụng thông tin hiện tại về trạng thái sẵn sàng, trạng thái công cụ được hỗ trợ, sự hiện diện của mô hình được yêu cầu và tải công việc. Nó chọn một nút đủ điều kiện, và bộ định tuyến PAIR trên hệ thống đó chuyển yêu cầu đến công cụ suy luận cục bộ. Các cuộc gọi độc lập từ các tác tử phụ khác có thể được phân bổ cho các nút sẵn sàng khác cùng lúc.
Trả về phản hồi và làm cho việc định tuyến trở nên rõ ràng
Động cơ được chọn sẽ thực thi yêu cầu, và PAIR phát trực tuyến phản hồi trở lại qua cùng giao diện cục bộ đó đến ứng dụng nguồn. Các chế độ xem Jobs (Công việc) và metrics (số liệu) hiển thị nút nào đã xử lý từng yêu cầu được định tuyến, giúp việc đặt vị trí có thể quan sát được.
Những tác vụ nào được hưởng lợi nhiều nhất từ PAIR?
PAIR hữu ích nhất cho các tác vụ xử lý có nhiều yêu cầu độc lập được thực hiện đồng thời, bao gồm các ứng dụng đa tác nhân và các công cụ AI cục bộ chạy đồng thời.
Đối với các tác vụ xử lý đó, PAIR có thể:
- Định tuyến các công việc độc lập trên các hệ thống sẵn có trong mạng nội bộ
- Giảm thời gian chờ đợi khi nhiều yêu cầu khác phải xếp hàng chờ xử lý trên một động cơ nội bộ
- Cải thiện thời gian hoàn thành cho một tác vụ có độ song song phù hợp trong cấu hình tương thích
- Giúp giải phóng máy tính chính để chơi game, sáng tạo hoặc thực hiện các tác vụ tương tác khác
- Giữ cho quy trình làm việc của ứng dụng quen thuộc và ưu tiên cục bộ
PAIR không làm:
- Ghép các GPU hoặc gộp VRAM thành một bộ tăng tốc lớn hơn
- Chia nhỏ một mô hình duy nhất hoặc phân chia một yêu cầu suy luận trên nhiều máy
Các tác vụ có tính tuần tự cao, các khối công việc bị chi phối bởi một lệnh gọi mô hình dài duy nhất, hoặc các cấu hình mà chỉ một nút có mô hình được yêu cầu có thể thấy ít lợi ích hơn. Hãy đo lường khối công việc quan trọng bằng cách sử dụng thời gian hoàn thành cuối cùng, thời gian chờ, chất lượng đầu ra và định tuyến quan sát được trên các hệ thống thực tế đang sử dụng.
Bắt đầu với NVIDIA PAIR
PAIR mang lại trải nghiệm giống như một cụm máy tính cho các hệ thống NVIDIA động đã có trong gia đình, đồng thời giữ cho quy trình suy luận cục bộ quen thuộc. Hãy làm theo các bước dưới đây để bắt đầu:
- Tải xuống bản beta của NVIDIA PAIR cho hệ thống Windows, macOS hoặc Linux được hỗ trợ.
- Cài đặt PAIR trên các máy tính NVIDIA RTX, máy trạm NVIDIA RTX PRO hoặc hệ thống NVIDIA DGX Spark để bao gồm.
- Khám phá và ghép nối an toàn các hệ thống trên mạng cục bộ.
- Bật Ollama hoặc LM Studio và tải xuống hoặc đặt các mô hình cần thiết trên các nút đủ điều kiện.
- Chạy một tác tử tương thích trên hệ thống đã cài đặt PAIR, sử dụng Ollama hoặc LM Studio.
Dự án NVIDIA PAIR là mã nguồn mở. Các nhà phát triển có thể xem mã nguồn, báo cáo sự cố và đóng góp các cải tiến cho việc khám phá, ghép nối, định tuyến, tích hợp công cụ, mô hình, điểm cuối và trải nghiệm người dùng.
Bài viết liên quan
- Xây dựng Hệ thống An ninh mạng Thích ứng dựa trên với NVIDIA Nemotron
- Bộ công cụ CUDA hiện đại trong thực tiễn: Hướng dẫn tối ưu hóa từng bước
- GPU Sizing: Cách lựa chọn cấu hình GPU cho quá trình suy luận AI để tối ưu tổng chi phí sở hữu
- Cách đánh giá các chính sách Robot đa năng cho triển khai thực tế
- Xác suất xảy ra các sự kiện cực đoan với các mô hình tạo sinh được hướng dẫn

