Triển khai NVIDIA Cosmos 3 sau huấn luyện trong một ngày bằng Kỹ năng Agent

Điều gì sẽ xảy ra nếu các tác nhân mã hóa tự trị AI có thể đẩy các mô hình suy luận thị giác của bạn lên trên 90% độ chính xác mà hầu như không cần nỗ lực thủ công? Khi điều chỉnh các mô hình suy luận thị giác cho các tác vụ video sản xuất, các nhà phát triển thường mất nhiều ngày cho việc định dạng dữ liệu, thiết lập container, tập lệnh huấn luyện, đánh giá cơ sở và quét siêu tham số trước cả khi họ biết liệu việc huấn luyện sau có cải thiện độ chính xác hay không.

Việc kết hợp mô hình nền tảng physical AI với NVIDIA Cosmos 3 cùng với các kỹ năng tác nhân NVIDIA TAO agent skills mang lại giải pháp cho thách thức này. Cosmos 3 kết nối sự hiểu biết, tạo sinh, mô phỏng và hành động thông qua một mô hình thế giới đa phương thức chung. Nó hợp nhất văn bản, hình ảnh, video, âm thanh môi trường và theo dõi hành động dưới kiến trúc mixture-of-transformers (MoT). Mặc dù mô hình cung cấp khả năng suy luận thị giác vượt trội ngay khi sử dụng, mọi triển khai trong thế giới thực đều đòi hỏi sự chuyên môn hóa theo lĩnh vực để xử lý các góc máy ảnh độc đáo, các trường hợp ngoại lệ và môi trường. Đây là lúc việc huấn luyện sau (post-training) trở nên quan trọng.

Bài đăng này minh họa cách bạn có thể tinh chỉnh sau huấn luyện liền mạch mô hình NVIDIA Cosmos 3 Nano cho việc trả lời câu hỏi bằng video bằng cách sử dụng một tác nhân mã hóa và thư viện NVIDIA TAO các kỹ năng tinh chỉnh tác nhân mô hình thị giác.

Các thử nghiệm của NVIDIA cho thấy rằng bằng cách sử dụng Low-Rank Adaptation (LoRA), quy trình làm việc đã điều chỉnh mô hình một cách hiệu quả, ngay lập tức nâng điểm cơ sở zero-shot từ độ chính xác khớp chính xác 54.41% (trắc nghiệm nhiều lựa chọn 4 chiều) lên mức ấn tượng 87.14% chỉ trong một lần chạy. Và bằng cách tận dụng TAO AutoML để quét các cấu hình một cách có hệ thống và loại bỏ phỏng đoán, nó đã đẩy độ chính xác cao nhất lên 93.35%, cô đọng những gì lẽ ra là một nỗ lực kỹ thuật kéo dài nhiều ngày thành một ngày thực thi tự động duy nhất, được điều khiển bởi một vài lời nhắc ngôn ngữ tự nhiên.

Video 1. Tìm hiểu từng bước cách huấn luyện hậu kỳ Cosmos 3 Nano với các kỹ năng tác nhân NVIDIA TAO, từ thiết lập cho đến quá trình quét AutoML và báo cáo cuối cùng

Lợi ích của kiến trúc Cosmos 3 MoT là gì?

NVIDIA Cosmos 3 kiến trúc MoT sử dụng bộ biến đổi tự hồi quy để suy luận và lập kế hoạch mạnh mẽ, kết hợp với bộ biến đổi khuếch tán để dự đoán chính xác các trạng thái và hành động của thế giới trong tương lai. Có sẵn ở nhiều kích cỡ bao gồm Super 64BNano 16B, Cosmos 3 liên tục xếp hạng số 1 trong số các mô hình mở trên các tiêu chuẩn đánh giá, bao gồm:

Hình 1 cho thấy thiết kế tháp kép hợp nhất được chia thành một đường dẫn suy luận tự hồi quy và một đường dẫn tạo khuếch tán lặp lại. Các đầu vào dành riêng cho phương thức được mã hóa thành token và xử lý thông qua các khối LayerNorm và MLP riêng biệt, tương tác thông qua kết nối luồng chéo nơi các trạng thái khóa-giá trị (KAR, VAR) được truyền đến khối chú ý đầy đủ tạo sinh cho ngữ cảnh văn bản và hình ảnh.

A technical block diagram showing the dual-tower Mixture-of-Transformers structure of NVIDIA Cosmos 3. On the left, five input boxes for text, image, video, audio, and action feed tokenized arrays into a central block. The central block is split into an Autoregressive tower and a Diffusion tower. The Autoregressive tower displays a vertical flowchart: Layer Norm, Causal Self Attention, Layer Norm, and MLP. A green dashed arrow labeled K sub A R, V sub A R extends from the Causal Self Attention block to the Diffusion towerHình 1. Kiến trúc chi tiết của lớp MoT NVIDIA Cosmos 3

Phương pháp hậu huấn luyện nào là tối ưu cho Cosmos 3 Nano?

Các mô hình nền tảng như Cosmos 3 học các mẫu tổng quát từ các tập dữ liệu khổng lồ, đa dạng. Huấn luyện sau là điều cần thiết để giúp các mô hình hiểu tốt hơn các tác vụ miền chuyên biệt, từ vựng và các góc nhìn camera cụ thể.

Khi nói đến các mô hình suy luận ngôn ngữ thị giác hậu huấn luyện như Cosmos 3 Nano, các nhà phát triển thường lựa chọn giữa hai phương pháp:

  • Tinh chỉnh có giám sát toàn tham số (SFT): Tốt nhất khi sự thay đổi miền là rất lớn hoặc nhiệm vụ đòi hỏi thay đổi cấu trúc mô hình. Tuy nhiên, vì SFT cập nhật tất cả các trọng số của mô hình, nó đòi hỏi tài nguyên tính toán lớn và có thể cho thấy sự suy giảm về kiến thức chung.
  • Thích ứng hạng thấp (LoRA): Lý tưởng cho việc lặp lại nhanh chóng. LoRA đóng băng các trọng số của mô hình cơ sở và tiêm các ma trận phân rã hạng có thể huấn luyện được.

Đối với ví dụ được trình bày chi tiết trong bài đăng này, việc huấn luyện sau này bằng LoRA yêu cầu ít hơn khoảng ~7 lần giờ GPU so với SFT toàn tham số cho Cosmos 3 Nano, biến việc hoàn thành huấn luyện sau một ngày thành hiện thực đối với các nhóm kỹ thuật.

Các tùy chọn để huấn luyện sau (post-train) Cosmos 3 Nano là gì?

Có hai tùy chọn để huấn luyện lại Cosmos 3 Nano:

  • Khung mở (Open framework): Khung hậu huấn luyện Cosmos 3 hoàn toàn mở này phơi bày các công thức huấn luyện, định dạng tập dữ liệu và tệp cấu hình trực tiếp, vì vậy bạn có thể xây dựng và sở hữu mọi bước của quy trình hậu huấn luyện. Đây là lựa chọn phù hợp nếu bạn cần logic huấn luyện tùy chỉnh hoặc muốn tích hợp với cơ sở hạ tầng hiện có.
  • Các kỹ năng agent TAO: Các kỹ năng này được xây dựng trên khả năng tương tự và tự động hóa nó. Một agent lập trình suy luận qua quy trình làm việc, vá các vấn đề dữ liệu, chạy container huấn luyện và quét các siêu tham số cho bạn. Sự tự động hóa này là thứ giúp rút ngắn một thiết lập nhiều ngày thành trải nghiệm một ngày, hai lời nhắc được nêu trong các phần sau.

A systems diagram showing a coding agent processing a user prompt to orchestrate a post-training routine using TAO agent skills. Paths connect real data into Data Enhanced Fine-Tuning (DEFT) loop containing auto-labeling, mining, Cosmos synthetic data generation, and gap analysis modules, which link into an AutoML hyperparameter sweep box. Hình 2. Cơ sở hạ tầng hậu huấn luyện agentic của NVIDIA TAO

NVIDIA TAO giới thiệu các kỹ năng agent giúp các agent lập trình thực hiện quy trình làm việc hậu huấn luyện mô hình thị giác cho các dòng mô hình được hỗ trợ. Các kỹ năng này đóng gói kiến thức cụ thể cho nhiệm vụ cần thiết để huấn luyện, đánh giá, tối ưu hóa và phục vụ các mô hình, bao gồm chi tiết framework, hành vi của launcher, cấu trúc cấu hình, tải dữ liệu và quy trình đánh giá.

Thay vì tự mình lắp ráp từng lệnh và tệp cấu hình, các kỹ năng của TAO cho phép một tác nhân mã hóa suy luận qua quy trình làm việc và tạo ra các bước chính xác.

Kiến trúc Cosmos 3 tách các khả năng của nó thành một tháp Reasoner (một mô hình ngôn ngữ thị giác để hiểu đa phương thức và logic) và một tháp Generator (để tạo video và hành động). Khi sử dụng các kỹ năng của tác nhân TAO, quy trình làm việc tự động xử lý việc tách các trọng số này, đảm bảo rằng việc huấn luyện sau của bạn chỉ nhắm mục tiêu và tối ưu hóa các trọng số Reasoner cho các tác vụ hạ nguồn của bạn.

Cách cài đặt các kỹ năng TAO cho một tác nhân lập trình

Bộ kỹ năng TAO có thể được cài đặt để sử dụng bởi bất kỳ tác nhân mã hóa nào. Ví dụ này sử dụng Codex. Các hướng dẫn thiết lập tương tự cũng có sẵn cho Claude trong NVIDIA-TAO/tao-skill-bank

Kho lưu trữ GitHub. Đường dẫn thiết lập nhanh nhất là sử dụng tập lệnh cài đặt tự động từ kho lưu trữ ngân hàng kỹ năng TAO.

curl -fsSL https://raw.githubusercontent.com/NVIDIA-TAO/tao-skills-bank/main/scripts/install-codex-agents.sh | bash

Nếu bạn muốn tự mình lái từng bước, repo cũng chia kịch bản thành các bước.

Trước khi bắt đầu thí nghiệm, hãy điền môi trường terminal của bạn với các khóa cần thiết:

export HUGGINGFACE_TOKEN="your_hf_token" #To pull missing models
export NGC_API_KEY="your_ngc_key" #For TAO Docker containers
export AUTOML_LLM_API_KEY="your_llm_key" #Required for LLM-guided hyperparameter sweeps in AutoML

Dataset

Ví dụ này cho thấy cách huấn luyện lại (post-train) Cosmos 3 Nano trên tập dữ liệu Woven Traffic Safety (WTS) từ Toyota, có thể truy cập tại Woven Traffic Safety (WTS) dataset. Thí nghiệm tập trung vào nhiệm vụ trả lời câu hỏi video trắc nghiệm bốn lựa chọn, bao gồm hơn 8.000 mẫu huấn luyện và xác thực.

Bộ dữ liệu này hữu ích để minh họa việc huấn luyện sau (post-training) cho Cosmos 3 vì an toàn giao thông đòi hỏi sự hiểu biết chi tiết về các cảnh thực tế. Mô hình phải suy luận về các bố cục đường phức tạp, tín hiệu, phương tiện, người đi bộ và ngữ cảnh sự kiện từ video (Hình 3). Nhưng quy trình làm việc tương tự cũng áp dụng cho bất kỳ tác vụ suy luận thị giác hạ nguồn nào, chẳng hạn như giám sát nhà kho, nhận thức của xe tự hành, các ô làm việc của robot và nhiều hơn nữa.

Dataset example

Câu hỏi: Hình dạng của con đường là gì?

  • A: Đường đơn (cong phải)
  • B: Đường đơn (thẳng)
  • C: Giao điểm (không có tín hiệu)
  • D: Giao điểm (với tín hiệu)

Câu trả lời mong đợi: D

Visual overview of the Woven Traffic Safety (WTS) validation dataset, showing multiple vantage points of urban and residential road structures used to test the modelHình 3. Tổng quan trực quan về bộ dữ liệu An toàn Giao thông Woven (WTS)

Cách chạy huấn luyện sau LoRA với một lời nhắc duy nhất

Trong cùng môi trường mà bạn đã xuất thông tin xác thực, bạn có thể khởi chạy toàn bộ quy trình đầu cuối với một lời nhắc Codex duy nhất:

Perform LoRA post-training of the Cosmos 3 model on the Woven Traffic Safety dataset.
Training data: /home/…/WTS_dataset/wts_data_train
Validation data: /home/…/WTS_dataset/wts_data_val
Base model on Hugging Face: nvidia/Cosmos3-Nano
Also perform a baseline evaluation first, to compare with the post-trained model.

A functional flow diagram with numbered steps mapping out the process. Step 1 sets up the TAO skills, Step 2 runs the LoRA fine-tuning and evaluation using one prompt to coding agent, and Step 3 starts the AutoML experiment sweep with another prompt, before generating final reports. Hình 4. Trình tự thực thi quy trình từng bước để tinh chỉnh tác tử LoRA

Đằng sau hậu trường, Codex truy vấn thư viện TAO và chọn kỹ năng Cosmos-reason chuyên biệt. Tác tử tự động xử lý khung làm việc và bộ tải dữ liệu cơ bản và thực hiện theo trình tự sau:

  1. Tự động vá lỗi: Tác tử quét các chú thích của bộ dữ liệu, gắn cờ tham số FPS video bị thiếu và áp dụng bản vá cấu hình ngay lập tức.
  2. Bộ nhớ đệm mô hình: Nó sử dụng token Hugging Face của bạn để kéo các trọng số Cosmos 3 một cách an toàn.
  3. Đánh giá cơ sở: Trước khi thay đổi bất kỳ trọng số nào, nó chạy một đánh giá cơ sở zero-shot. Mô hình Cosmos 3 cơ bản đạt độ chính xác ban đầu là 54.41%.
  4. Thực thi quy trình LoRA: Tác nhân tạo các cấu hình đào tạo LoRA được tối ưu hóa và kích hoạt container đào tạo TAO.

Khi quá trình đào tạo sau hoàn tất, tác nhân sẽ đánh giá mô hình được điều chỉnh bằng LoRA và so sánh kết quả với cơ sở.

Chỉ trong một lần chạy, và khoảng 30 phút đào tạo trên tám GPU NVIDIA A100 Tensor Core, mô hình đã đạt độ chính xác 87.14%, một cải thiện lớn là 32 điểm phần trăm, đạt được hoàn toàn tự động.

Cách tối ưu hóa một mô hình thị giác với TAO AutoML

LoRA cung cấp một kết quả ban đầu mạnh mẽ, nhưng hiệu suất sau đào tạo thường phụ thuộc vào việc chọn cấu hình phù hợp. Tốc độ học, hạng LoRA, dropout, kích thước lô, cài đặt bộ lập lịch và các siêu tham số khác đều có thể ảnh hưởng đến độ chính xác cuối cùng.

Thay vì thử thủ công từng cấu hình một, TAO AutoML cho phép tác nhân chạy một quá trình quét có cấu trúc trên các tham số đào tạo sau quan trọng.

TAO AutoML hỗ trợ một loạt các chiến lược tìm kiếm tham số, bao gồm nhưng không giới hạn ở:

  • Tối ưu hóa Bayesian
  • Hyperband
  • Tối ưu hóa Bayesian và Hyperband
  • Tối ưu hóa Bayesian theo lô đầu tiên
  • Tìm kiếm được hướng dẫn bởi LLM đề xuất các siêu tham số bằng cách sử dụng bộ não LLM (NVIDIA NIM, OpenAI hoặc bất kỳ điểm cuối tương thích với OpenAI nào). Yêu cầu NVIDIA_API_KEY hoặc AUTOML_LLM_API_KEY. Đối với thử nghiệm này, điểm cuối Gemini API đã được sử dụng.

Để biết giải thích ngắn gọn về từng thuật toán, hãy xem tài liệu thuật toán TAO AutoML TAO AutoML.

Với một lời nhắc khác trong cuộc trò chuyện của tác nhân mã hóa, bạn có thể yêu cầu tác nhân chạy quét AutoML:

Run an AutoML sweep to improve the LoRA result. Let TAO choose suitable search strategies 
and tune the important training hyperparameters. Optimize validation accuracy and summarize 
the best models.

Tác nhân tạo ra các thử nghiệm ứng viên bằng cách sử dụng nhiều chiến lược, khởi chạy từng thử nghiệm, theo dõi các siêu tham số, đánh giá kết quả và ghi lại các cấu hình tốt nhất.

LoRA và AutoML đã mang lại những cải tiến về độ chính xác nào?

Bằng cách kết hợp tính tự động hóa của các kỹ năng tác nhân TAO với sức mạnh tối ưu hóa của TAO AutoML, mô hình đã đạt được những cải thiện đáng kể về độ chính xác so với cơ sở zero-shot. Toàn bộ thử nghiệm đã tiến triển từ một mô hình cơ sở chưa được căn chỉnh thành một chuyên gia an toàn giao thông chuyên biệt cao chỉ với hai lời nhắc.

Biến thể mô hình Chiến lược Độ chính xác xác thực Cải thiện so với cơ sở
Cosmos 3 Nano (Cơ sở) Mức cơ sở zero-shot 54.41% Tham khảo
Cosmos 3 Nano + LoRA Mức cơ sở LoRA một lời nhắc 87.14% +32.73 điểm phần trăm
Cosmos 3 Nano + AutoML Tối ưu hóa Bayesian 93.35% +38.94 điểm phần trăm

Bảng 1. Cải thiện độ chính xác xác thực của Cosmos 3 Nano trên các chiến lược hậu huấn luyện khác nhau

Cần dự kiến phần cứng và thời gian chạy nào?

Phần cứng NVIDIA dựa trên đám mây đã được sử dụng để kiểm tra các lần quét thử nghiệm đa cấu hình của các kỹ năng TAO. Nhờ hiệu quả của kiến trúc Cosmos 3 MoT, một epoch hậu huấn luyện LoRA đơn lẻ mất khoảng 30 phút trên một node của GPU NVIDIA A100 (80 GB). Điều này có nghĩa là trong vòng chưa đầy một giờ, bạn có thể nhanh chóng khởi chạy một mô hình có độ chính xác cao đạt 87.14%.

Tuy nhiên, như một làm rõ quan trọng, nếu bạn muốn đẩy độ chính xác của mình vượt qua ngưỡng này, việc tìm cấu hình tối ưu đòi hỏi một lần quét siêu tham số TAO AutoML. Trong môi trường thử nghiệm này, việc này mất 19,5 giờ để xử lý 43 thử nghiệm song song, chạy hoàn toàn song song trên nhiều node GPU A100 được lưu trữ trên Oracle Cloud Infrastructure (OCI).

Để so sánh, một lần chạy SFT đầy đủ tham số mất 3 giờ 34 phút trên GPU NVIDIA H100.

Kết quả hậu huấn luyện định tính là gì?

Các con số chỉ kể một phần câu chuyện. Giá trị thực sự của việc chuyên môn hóa miền thể hiện khi đánh giá các trường hợp biên thực tế phức tạp, mơ hồ. Hình 5 và 6 cho thấy sự so sánh định tính trước và sau khi hậu huấn luyện mô hình.

A video playback frame showing an overhead view of a roadway intersection with a crosswalk. A red bounding box highlights a small, distant traffic signal on the far left that the baseline model missed but the post-trained model correctly used to identify the scene as an intersection with a signal. Hình 5. So sánh định tính về lý luận hình thành đường trước và sau khi huấn luyện lại mô hình

A video playback frame displaying a wide intersection flanked by crosswalk markings, green landscape medians, and distant low-rise buildings. Labels show the base model misidentifying it as a parking lot, while the post-trained model accurately labels it a residential road. Hình 6. So sánh định tính về phân loại loại đường giữa mô hình cơ sở và mô hình tối ưu

Cách triển khai bộ điều hợp Cosmos 3 LoRA đã được huấn luyện lại  

Cosmos 3 Reasoner NIM cung cấp con đường nhanh nhất để có một điểm cuối Reasoner tương thích với OpenAI, sẵn sàng cho sản xuất. Nó có một reasoner tự hồi quy được cô lập và tối ưu hóa, được xây dựng để suy luận hiệu quả trên thiết bị. Các microservice NIM được cung cấp dưới dạng các container được tối ưu hóa, dựng sẵn, cho phép bạn hoàn toàn bỏ qua các phụ thuộc vLLM thủ công hoặc các cấu hình ghép đôi CUDA phức tạp.

Nó tự nhiên phục vụ các đầu ra văn bản từ các đầu vào văn bản, hình ảnh và video. Để triển khai mô hình đã được huấn luyện sau, chỉ cần truyền trực tiếp thư mục bộ điều hợp LoRA đã được huấn luyện sau của bạn vào môi trường NIM trong quá trình triển khai.

Hãy xem video hướng dẫn Cách chạy NVIDIA Cosmos 3 Reasoner NIM cho Suy luận Video để biết hướng dẫn từng bước về việc phục vụ mô hình Cosmos 3 bằng NIM. Để tích hợp các bộ điều hợp LoRA, hãy tham khảo tài liệu NVIDIA NIM.

Bắt đầu hậu huyến luyện(post-training) với Cosmos 3

Việc chuyển đổi từ AI đa dụng sang AI vật lý chuyên biệt cao không còn đòi hỏi phải vật lộn với cơ sở hạ tầng. Bằng cách kết hợp sức mạnh suy luận cấu trúc của tháp NVIDIA Cosmos 3 Reasoner với khả năng tự động hóa của các kỹ năng tác nhân NVIDIA TAO, bạn có thể chuyển đổi từ dữ liệu video thô sang một mô hình ngôn ngữ-thị giác chuyên biệt, sẵn sàng triển khai chỉ trong một ngày.

Với hai lời nhắc ngôn ngữ tự nhiên, tác nhân mã hóa xử lý sự phức tạp của framework, vá các lỗi dữ liệu, thực hiện các bài kiểm tra cơ sở và chạy tinh chỉnh siêu tham số nâng cao thông qua TAO AutoML hoàn toàn không cần can thiệp thủ công, cho phép các nhóm kỹ thuật tập trung vào việc giải quyết các thách thức cốt lõi về AI vật lý và robot.

Sẵn sàng để huấn luyện các mô hình suy luận thị giác của riêng bạn? Hãy xem các tài nguyên này để triển khai quy trình làm việc trong môi trường phát triển cục bộ của bạn:

____
Bài viết liên quan
TAG: , ,