Agentic AI có thể được sử dụng để chuẩn bị và xác thực bản sao số cho các hệ thống Physical AI. Các tác nhân có thể kiểm tra các cảnh 3D, tạo dữ liệu liên quan đến mô phỏng trong OpenUSD, thêm các thuộc tính vật lý, hiển thị trước các chế độ xem tiền kiểm và xác thực kết quả so với các yêu cầu sẵn sàng mô phỏng (SimReady). Quy trình này tuân theo các bước từ một cảnh trong Blender đến việc chuyển giao OpenUSD sẵn sàng mô phỏng cho NVIDIA Isaac Sim hoặc NVIDIA Isaac Lab.
Tuy nhiên, trong thực tế, nếu bạn đang xây dựng các tác nhân cho robot, quy trình thường dễ bị mắc kẹt. Rất dễ đổ lỗi cho phần khó khăn nhất là chính sách, mô hình hoặc vòng huấn luyện, nhưng nút cổ chai thường xảy ra sớm hơn: robot không có một thế giới sẵn sàng mô phỏng để huấn luyện. Lượng công việc bổ sung cần thiết để đưa một cảnh 3D vào trạng thái đó là công phu, tốn thời gian và thường nằm ngoài phạm vi công việc của kỹ sư mô phỏng robot.
Bài viết này trình bày quy trình làm việc của một tác nhân (agent) để chuẩn bị một cảnh Blender cho mô phỏng robot bằng cách sử dụng NVIDIA Omniverse Libraries. Codex, được cung cấp sức mạnh bởi OpenAI GPT-6 Astra, điều phối nhiệm vụ tổng thể, diễn giải kết quả và hướng dẫn quá trình lặp lại. Các tác nhân chuyên biệt được xây dựng với Hermes agent harness và triển khai thông qua NVIDIA NemoClaw sử dụng Omniverse Libraries để kiểm tra cảnh, tạo siêu dữ liệu mô phỏng, định cấu hình vật lý và hiển thị các chế độ xem kiểm tra trực quan trước khi chạy.
Cùng nhau, các thành phần này kết nối suy luận, thực thi công cụ và xác nhận vào một quy trình có thể lặp lại để cung cấp một thế giới OpenUSD sẵn sàng cho mô phỏng.
Tại sao việc chuẩn bị một cảnh 3D cho mô phỏng lại khó khăn?
Cảnh đã tồn tại—các tài sản có sẵn, được tạo bởi một họa sĩ 3D trong Blender—nhưng liệu nó có thể sử dụng được cho mô phỏng không? Tất cả các bước chuẩn bị sau đây đã được thực hiện chưa?
- Các đối tượng đã được gán nhãn chưa?
- Các lưới va chạm (collision meshes) đã chính xác chưa?
- Các vật liệu có ý nghĩa đối với mô phỏng không?
- Các cảm biến đã được đặt và cấu hình chưa?
- Đoạn xuất cảnh có sạch sẽ sang USD không?
- Robot có thể nhận diện các đối tượng mục tiêu không?
- Liệu cảnh có vượt qua kiểm tra xác thực trước khi bạn bỏ thời gian gỡ lỗi nó trong Isaac Sim hay Isaac Lab không?
Công việc chuẩn bị này tốn nhiều công sức, lặp đi lặp lại và dễ mắc sai sót. Đây cũng chính là loại công việc mà các hệ thống tác nhân nên hỗ trợ, nếu chúng có các công cụ phù hợp. Mục đích của việc sử dụng NVIDIA Omniverse Libraries trong quy trình tác nhân là tích hợp các công cụ mà các tác nhân cần để xây dựng các thế giới sẵn sàng mô phỏng (SimReady).
Các agent (tác nhân) có thể hỗ trợ chuẩn bị một cảnh 3D cho mô phỏng như thế nào?
Một agent đa năng như Codex của ChatGPT hoặc Claude Cowork của Anthropic có thể xem qua một cảnh Blender và nhận ra rằng nó cần được chuẩn bị để sẵn sàng cho mô phỏng. Việc nhận diện là hữu ích, nhưng chưa đủ. Để hỗ trợ một nhà phát triển robot, agent phải có khả năng thực hiện các hành động trên cảnh:
- Kiểm tra cảnh Blender
- Xác định siêu dữ liệu mô phỏng bị thiếu
- Thêm nhãn ngữ nghĩa
- Cấu hình cảm biến
- Tạo hình va chạm và thuộc tính vật lý
- Hiển thị các chế độ xem tiền kiểm tra trực quan
- Chạy xác thực SimReady
- Tự động sửa các vấn đề bảo mật
- Đẩy các quyết định mơ hồ lên cho con người xử lý
Một yêu cầu rộng rãi nhằm chuẩn bị một cảnh 3D sẵn sàng cho mô phỏng sẽ trở thành một quy trình kỹ thuật đa tác nhân. Codex hoặc Claude đóng vai trò là tác nhân chính, điều phối toàn bộ nhiệm vụ chuẩn bị cảnh cho mô phỏng. NVIDIA NemoClaw cung cấp một kiến trúc tham chiếu để xây dựng các tác nhân con chuyên biệt thực hiện từng công việc. Các tác nhân con này có thể sử dụng các khung điều khiển tác nhân mã nguồn mở như Hermes, OpenClaw hoặc LangChain, được cấu hình với các mô hình NVIDIA Nemotron khác nhau cho thị giác, suy luận và sử dụng công cụ.
Trong một cấu hình sử dụng Astra và Hermes, Codex dùng Astra để chuyển đổi mục tiêu của nhà phát triển thành các tác vụ, xác định các phụ thuộc và xem xét kết quả từ các subagent Hermes chuyên biệt được triển khai thông qua NemoClaw. Ví dụ, việc làm cho một đối tượng có thể nắm bắt được đòi hỏi các cập nhật phối hợp đối với nhãn ngữ nghĩa, cấu hình vật thể cứng và hình học va chạm của nó. Astra giúp kết nối những yêu cầu này giữa các subagent và xác định những kiểm tra nào là cần thiết trước khi quy trình tiếp tục.
Các thư viện NVIDIA Omniverse cung cấp các công cụ mà các subagent gọi để tác động lên cảnh. Các thao tác OpenUSD thiết lập cấu trúc cảnh dùng chung, ovphysx tạo ra và kiểm tra các thuộc tính vật lý, ovrtx hiển thị các chế độ xem tiền kiểm trực quan, và xác thực SimReady đánh giá các tài sản kết quả so với hồ sơ mô phỏng mục tiêu.
Mỗi sub-agent chịu trách nhiệm một công việc cụ thể và các tiêu chí chấp nhận tương ứng. Các vấn đề an toàn và cơ khí có thể được khắc phục tự động. Các quyết định phụ thuộc vào ý định của nhà phát triển, chẳng hạn như nhãn ngữ nghĩa không chắc chắn hoặc hành vi vật lý, sẽ được chuyển lên cho con người liên quan cùng với ngữ cảnh phù hợp và một bước tiếp theo được đề xuất.
Mẫu này là:
- Codex hoặc Claude điều phối
- Các tác nhân NemoClaw suy luận
- Thư viện Omniverse hoạt động
Cùng nhau, các lớp này biến lời nhắc “Chuẩn bị mô phỏng cho cảnh này” thành quy trình làm việc dựa trên công cụ với các công việc chuyên biệt, trạng thái cảnh liên tục, cổng xác thực và đánh giá của con người nơi cần đến phán đoán.
Hình 1. Quy trình tham chiếu minh họa cách sử dụng Omniverse Libraries để kích hoạt một cảnh Blender với các tác nhân
Cách sử dụng tác nhân để chuẩn bị một cảnh 3D cho mô phỏng
Bắt đầu bằng cách xác định mục tiêu chính cho tác nhân điều phối, bao gồm đầu vào, đầu ra mong muốn, đích đến và tiêu chí xác thực. Điều này cung cấp cho Codex hoặc Claude đủ cấu trúc để phối tác vụ tổng thể, phân phối công việc giữa các tác nhân phụ NemoClaw chuyên biệt và quyết định khi nào công việc thực sự hoàn tất.
Input: Blender scene Goal: Prepare it for robotics simulation Output: USD-based simulation-ready world Destination: Isaac Sim or Isaac Lab Validation: Visual preflight + SimReady validation
Bằng cách xác định mục tiêu chính, nhiệm vụ chuyển từ việc đơn thuần là “làm cho cảnh này tốt hơn” sang một quy trình làm việc phối hợp của các tác nhân. Codex hoặc Claude quản lý yêu cầu tổng thể, các tác nhân phụ NemoClaw suy luận qua các công việc chuyên biệt, và Omniverse Libraries cung cấp các công cụ để sửa đổi, hiển thị, xác thực và chuẩn bị thế giới.
Sau khi đặt mục tiêu, hãy làm theo các bước dưới đây.
Bước 1: Kiểm tra cảnh qua Blender MCP
Subagent đầu tiên kết nối với Blender thông qua Máy chủ Giao thức Ngữ cảnh Mô hình (MCP) và sử dụng nó để lập danh mục hiện trường. MCP cung cấp cho agent một giao diện công cụ có kiểm soát vào Blender: thay vì đoán từ ảnh chụp màn hình hoặc dựa vào việc xuất thủ công, agent có thể gọi các công cụ để kiểm tra các đối tượng, bộ sưu tập, phép biến đổi, vật liệu, máy ảnh, đèn và siêu dữ liệu của hiện trường. Danh mục hiện trường này trở thành ngữ cảnh chung mà các subagent còn lại sử dụng.
Subagent này nên trả lời:
- Những đối tượng nào tồn tại?
- Những bộ sưu tập và cấu trúc phân cấp nào tồn tại?
- Những vật liệu nào được gán?
- Những máy ảnh và nguồn sáng nào có mặt?
- Cái gì trông giống như mục tiêu robot, vật cản, sàn, kệ hoặc thùng chứa?
- Dữ liệu mô phỏng còn thiếu là gì?
Đầu ra nên được cấu trúc như sau:
{
"objects": 142,
"materials": 37,
"missing": [
"semantic_labels",
"collision_meshes",
"camera_sensors",
"physics_materials"
]
}
Điều này cung cấp một điểm bắt đầu chung cho các subagent khác.
Hermes inspection subagent trả về các phát hiện có cấu trúc của nó cho Codex. Astra sử dụng danh mục này và mục tiêu robot học của nhà phát triển để xác định thông tin còn thiếu và lập kế hoạch cho các nhiệm vụ tiếp theo. Ví dụ, việc xác định các đối tượng mục tiêu của robot giúp xác định tài sản nào cần có thuộc tính vật thể di chuyển và góc nhìn cảm biến nào cần được xem xét. Codex sau đó ủy thác các nhiệm vụ đó cho các Hermes subagent liên quan được triển khai thông qua NemoClaw, với các tiêu chí chấp nhận rõ ràng và các giả định chưa được giải quyết được đánh dấu để nhà phát triển cung cấp thông tin.
Quy trình trong bài viết này sử dụng The Junk Shop của Alex Trevino (khái niệm gốc bởi Anais Maamar) cho bản trình diễn (Hình 2). Codex điều phối NemoClaw để sắp xếp subagent nào cần thiết cho nhiệm vụ được yêu cầu. Trong trường hợp này, NemoClaw đang làm việc thông qua Blender MCP để chạy cảnh The Junk Shop và lập danh mục các đối tượng, vật liệu, cấu trúc cảnh và nhiều hơn nữa.
Hình 2. Phần bổ trợ Blender kết nối dữ liệu cảnh với Thư viện Omniverse thông qua gRPC, cho phép khả năng hiển thị và vật lý được phản hồi trực tiếp vào Cửa sổ xem Blender
Bước 2: Hướng tới việc sử dụng USD làm hợp đồng
Blender là môi trường sáng tạo nội dung. USD là định dạng bàn giao mô phỏng vì nó cung cấp cho các tác nhân AI và các công cụ xử lý sau đó một biểu diễn chung, có cấu trúc về thế giới. Sau khi cảnh được tạo trong USD, các tác nhân con có thể kiểm tra các prims, thêm siêu dữ liệu, xác thực các yêu cầu và chuyển thế giới đó sang Isaac Sim hoặc Isaac Lab mà không phụ thuộc vào các quá trình xuất file riêng lẻ, thiếu ổn định.
Tác nhân AI sáng tạo nội dung USD sử dụng các thư viện Omniverse để bảo toàn cấu trúc phân cấp, các phép biến đổi, vật liệu, nhãn, siêu dữ liệu vật lý và định nghĩa cảm biến.
Một quy tắc hữu ích cho những người xây dựng agent là: nếu một agent hoặc trình mô phỏng khác cần dựa vào nó sau này, hãy đưa nó vào USD.
USD được thiết kế để cấu trúc cảnh phân lớp, không phá hủy, vì vậy các agent có thể thêm nhãn, siêu dữ liệu vật lý, định nghĩa cảm biến, vật liệu và dữ liệu xác thực mà không làm phẳng tác phẩm sáng tạo ban đầu. Điều này giữ cho quy trình làm việc không trở thành một tập hợp các chỉnh sửa tạm thời bị mắc kẹt trong một công cụ duy nhất và cung cấp cho mọi bước tiếp theo một nguồn sự thật chung, có thể kiểm tra được.
Hình 3. USD ghép cảnh cuối cùng từ các lớp con rời rạc (tài sản, ánh sáng và vật liệu), mỗi lớp có thể chỉnh sửa độc lập trước khi được kết hợp
Bước 3: Thêm nhãn ngữ nghĩa
Robot không chỉ cần hình học. Chúng cần ý nghĩa. Agent gán nhãn ngữ nghĩa biến các lưới đối tượng vô danh thành các đối tượng có nhận thức về nhiệm vụ: kệ, thùng, sàn, vật cản, vật thể có thể nắm giữ và mục tiêu của robot. Bằng cách soạn các nhãn này vào USD, quy trình cung cấp cho các agent và công cụ robot ở tầng dưới một từ vựng chung cho việc nhận thức, xác thực, dữ liệu tổng hợp và thiết lập huấn luyện.
Agent gán nhãn ngữ nghĩa gán các lớp liên quan đến nhiệm vụ cho các prims:
kệthùnghộpsànvật cảnvật có thể cầm nắm- robot_target
- no_go_zone
Agent có thể suy luận nhãn từ tên đối tượng, cấu trúc phân cấp, hình dạng và ngữ cảnh. Tuy nhiên, nó cũng cần đánh dấu những trường hợp không chắc chắn:
Tagged 118 prims. 9 labels need review.
Hình 4 cho thấy Codex điều phối NVIDIA NemoClaw. NemoClaw phối hợp với các subagent thông qua Blender MCP. Các thư viện NVIDIA Omniverse là công cụ mà các subagent sử dụng để thực hiện nhiệm vụ. Trong trường hợp này, agent ovrtx kiểm tra cảnh Blender thông qua quy trình này và áp dụng phân đoạn ngữ nghĩa cùng các nhãn cần thiết để chuẩn bị cảnh cho mô phỏng robot.
Hình 4. Codex điều phối NVIDIA NemoClaw để hoàn thành một nhiệm vụ thông qua Blender
Điều này rất quan trọng vì các nhãn trở thành cầu nối giữa nội dung cảnh và các quy trình làm việc robot: nhận dạng, thiết lập nhiệm vụ, dữ liệu tổng hợp và xác thực.
Bước 4: Làm cho vật liệu nhận biết được mô phỏng
Một vật liệu trông ổn trong Blender có thể vẫn chưa đầy đủ cho mục đích mô phỏng. Trong cửa sổ xem trước (viewport), có thể chỉ cần kệ trông giống kim loại hoặc thùng trông giống nhựa là đủ. Trong quy trình làm việc liên quan đến robot, các bề mặt đó cần có các thuộc tính vật liệu mà các hệ thống xử lý sau có thể sử dụng để kết xuất, cảm biến, vật lý, ngẫu nhiên hóa miền (domain randomization) và xác thực. Tác nhân vật liệu chuyển đổi diện mạo hình ảnh thành siêu dữ liệu hữu ích cho mô phỏng.
Agent vật liệu nên kiểm tra các vật liệu trực quan và tạo metadata vật liệu liên quan đến mô phỏng. Trong một cảnh kho hàng, điều đó có thể bao gồm việc nhận diện các kệ kim loại, thùng carton, thùng nhựa, sàn bê tông, bánh xe cao su hoặc tấm kính.
Mục tiêu không phải là tạo ra các vật liệu đẹp hơn. Mục tiêu là cung cấp thông tin hữu ích hơn cho việc mô phỏng và xác thực.
Hình 5. Trong Codex, một NemoClaw hoàn thành nhiệm vụ thông qua Blender. Một Material Subagent sử dụng MCP để giao tiếp với Blender, xác định các vật liệu trong cảnh 3D, kiểm tra thuộc tính của chúng và gắn nhãn trong metadata một cách phù hợp để các vật liệu có thể được máy đọc được
Bước 5: Tạo cảm biến sớm
Nếu robot cần nhận thức thế giới, các cảm biến không nên là yếu tố được cân nhắc sau cùng trong môi trường huấn luyện. Cấu hình camera và lidar định hình những gì robot có thể quan sát, dữ liệu nào được tạo ra, và liệu cảnh huấn luyện có phản ánh đúng nhiệm vụ thực tế hay không. Việc thiết lập cảm biến từ sớm cho phép các tác nhân xác minh vị trí đặt, trường nhìn, tầm hoạt động, tần suất lấy mẫu, hiện tượng che khuất và khả năng hiển thị của mục tiêu trước khi cảnh được đưa vào Isaac Sim hoặc Isaac Lab.
Một tác nhân con chuyên về cảm biến có thể thiết lập camera và cảm biến lidar vào cảnh bằng cách:
- Vị trí
- Hướng
- Trường nhìn
- Tần suất lấy mẫu
- Phạm vi
- Độ phân giải
- Khung hình mục tiêu
Cách tiếp cận này cho phép quy trình làm việc nêu ra các câu hỏi hữu ích trước khi bắt đầu huấn luyện:
- Robot có thể nhìn thấy mục tiêu không?
- Cảm biến có bị che khuất không?
- Trường nhìn có hữu ích không?
- Các đối tượng huấn luyện có hiển thị từ các góc nhìn dự kiến không?
Hình 6 cho thấy NemoClaw điều phối một phụ tác tử để gọi công cụ cần thiết cho nhiệm vụ: ovrtx. ovrtx tải một cảnh chứa lidar đã được cấu hình, khởi động đường ống cảm biến, hiển thị một khung đám mây điểm, đọc dữ liệu điểm hợp lệ bằng kênh count, in thống kê tóm tắt và trực quan hóa các điểm bằng màu sắc dựa trên cường độ.
Hình 6. NemoClaw điều phối một phụ tác tử để gọi công cụ cần thiết cho nhiệm vụ: ovrtx
Bước 6: Sử dụng ovphysx để đảm bảo tính sẵn sàng về vật lý
Tại thời điểm này, cảnh không còn chỉ mang tính hình ảnh. Nó trở thành một thế giới số song sinh có nhận thức vật lý. Các đối tượng không còn chỉ là các lưới đa giác (meshes) với vật liệu; chúng có hình dạng va chạm, khối lượng, ma sát, hành vi vật thể cứng và các quy tắc về cách chúng tương tác. Điều đó có nghĩa là một chiếc hộp có thể được nhấc lên, một chiếc kệ có thể chặn chuyển động, và một robot có thể thử nghiệm các hành động trong một thế giới có hành vi vật lý thay vì chỉ trông đúng đắn.
Subagent ovphysx thêm hoặc xác thực các mục sau:
- Lưới va chạm
- Bộ va chạm tĩnh
- Vật thể cứng
- Các thuộc tính khối lượng
- Ma sát
- Hệ số đàn hồi
- Vật liệu vật lý
- Đối tượng di động so với đối tượng cố định
Các lỗi phổ biến chính là những vấn đề nhàm chán, khó xử lý về sau:
46 objects missing collision meshes. 12 grabbable objects marked static. 7 collision meshes too complex. 3 props floating above the floor.
Agent ovphysx chịu trách nhiệm cho công việc này. Nó biến những phát hiện đó thành một kế hoạch sửa chữa, tự động áp dụng các biện pháp khắc phục an toàn và chuyển các trường hợp mơ hồ cho con người xử lý.
Ví dụ, agent có thể tạo các lưới va chạm đơn giản cho các đạo cụ tĩnh, đánh dấu sàn và kệ là các bộ va chạm cố định, gán các thuộc tính vật thể cứng cho các đối tượng có thể cầm nắm, và đánh dấu mọi thứ mà hành vi vật lý phụ thuộc vào ý định của nhiệm vụ. Kết quả đầu ra không chỉ là một cảnh quan sạch sẽ hơn; đó là một báo cáo sẵn sàng vật lý mà các agent hạ nguồn và công cụ xác thực có thể sử dụng.
Hình 7 cho thấy NemoClaw đang điều phối một tác tử con để gọi công cụ phù hợp cần thiết để kích hoạt tính năng vật lý cho cảnh 3D: ovphysx. ovphysx được sử dụng để thêm các thuộc tính vật thể cứng, bộ va chạm, khối lượng và ma sát nhằm đảm bảo rằng cảnh đã sẵn sàng cho mô phỏng khi được chuyển sang Isaac Sim hoặc Isaac Lab.
Hình 7. NemoClaw điều phối một tác tử con để gọi công cụ phù hợp cần thiết để kích hoạt tính năng vật lý cho cảnh 3D: ovphysx
Bước 7: Sử dụng ovrtx làm vòng lặp kiểm tra trước
Tại sao cần hiển thị hình ảnh trước khi mô phỏng? Bởi vì việc xác thực có thể cho phép một tác nhân biết rằng cảnh quan có cấu trúc chấp nhận được, nhưng việc hiển thị hình ảnh sẽ cho thấy liệu cảnh quan có thể sử dụng được hay không. Tác nhân ovrtx có thể tạo các chế độ xem camera robot và xem lại, kiểm tra các mục tiêu bị che khuất, ánh sáng không tốt, cảm biến bị cắt, vật liệu bị hỏng hoặc các đối tượng không thể đọc được, và chuyển các vấn đề về cho tác nhân sửa chữa phù hợp trước khi thời gian huấn luyện bị lãng phí.
Agent ovrtx hiển thị các góc nhìn để đánh giá và góc nhìn của robot, giúp quy trình làm việc có thể kiểm tra các điểm chính:
- Các đối tượng mục tiêu có hiển thị không?
- Các nhãn có được gắn vào các đối tượng có thể nhìn thấy không?
- Các vật liệu có được hiển thị đúng cách không?
- Ánh sáng có hợp lý về mặt vật lý không?
- Máy quay có bị che khuất hoặc cắt xén không?
- Tỷ lệ kích thước của đối tượng có hợp lý không?
Tại thời điểm này, ovrtx đang cung cấp chức năng kiểm tra chất lượng trực quan (QA) cho quy trình xử lý của agent.
Trình con agent Hermes, chạy trong môi trường NemoClaw, gọi ovrtx để tạo các hình ảnh xem xét và trả về chúng cùng với siêu dữ liệu cảnh liên quan cho Codex. Astra có thể sử dụng bằng chứng này để điều tra các sai lệch và phối hợp các nhiệm vụ theo dõi có mục tiêu. Nếu một mục tiêu đã được gán nhãn không xuất hiện trong góc nhìn của camera robot, Codex có thể yêu cầu các trình con agent cảm biến và kiểm tra cảnh kiểm tra hướng camera, cài đặt cắt (clipping) và các vật thể che khuất có thể xảy ra. Sau khi sửa chữa, trình con agent hiển thị tạo ra một góc nhìn khác để kết quả có thể được kiểm tra. Điều này kết nối việc xem xét hình ảnh với một vòng lặp sửa chữa có thể thực hiện được.
Hình 8. NemoClaw điều phối các trình con agent để gọi ovrtx và chạy báo cáo QA, kiểm tra xem các đối tượng mục tiêu có hiển thị không, nhãn có được gắn không, vật liệu có hiển thị đúng không, ánh sáng có hợp lý về mặt vật lý không, và camera có rõ ràng và không bị cắt (unclipped) không
Bước 8: Chạy xác thực SimReady
Cuối cùng, tác nhân xác thực chạy kiểm tra SimReady đối với hồ sơ mục tiêu. Đây là cửa ngõ chấp nhận cho quy trình làm việc của tác nhân. SimReady Foundation xác định các tiêu chuẩn và hồ sơ xác thực cho nội dung USD sẵn sàng mô phỏng, và tác nhân xác thực sử dụng các hồ sơ đó để kiểm tra xem cảnh có thực sự sẵn sàng để tiếp tục hay không. Nếu xác thực không đạt, báo cáo sẽ trở thành danh sách tác vụ cho các tác nhân sửa lỗi. Nếu đạt, cảnh sẽ sẵn sàng để chuyển giao cho Isaac Sim hoặc Isaac Lab.
Báo cáo phải mang tính hành động:
Validation failed: 14 issues - 10 auto-fixable - 4 require review
Các tác nhân sửa lỗi có thể khắc phục các vấn đề an toàn. Các lỗi không rõ ràng được báo cáo cho con người. Ví dụ: “Tôi đã tự động sửa 10 vấn đề xác thực. Bốn vấn đề cần xem xét: hai nhãn ngữ nghĩa không chắc chắn, một vật thể có thể nắm giữ với các cài đặt vật lý mâu thuẫn, và một vật thể có thể vừa là vật cản vừa là mục tiêu.” Con người phê duyệt hành vi dự định, sau đó các tác nhân áp dụng bản sửa lỗi và chạy lại xác thực.
Tiểu đại lý xác thực Hermes trả lại báo cáo SimReady cho Codex, nơi Astra giúp xác định những sửa chữa và kiểm tra theo dõi nào là cần thiết. Codex phân công các nhiệm vụ này cho các tiểu đại lý Hermes phù hợp được triển khai thông qua NemoClaw. Việc di chuyển một cảm biến có thể yêu cầu một lần kiểm tra độ hiển thị ovrtx khác, trong khi thay đổi vai trò của một đối tượng có thể yêu cầu cập nhật cả nhãn ngữ nghĩa và thuộc tính vật lý. Các tiểu đại lý áp dụng các thay đổi đã được phê duyệt và chạy lại các kiểm tra liên quan, và Codex tóm tắt các thay đổi, bằng chứng xác thực và các quyết định chưa được giải quyết dành cho nhà phát triển.
Mục tiêu là một cảnh đáp ứng hợp đồng mô phỏng, chứ không chỉ đơn thuần là một tệp xuất.
Hình 9 cho thấy NemoClaw đang điều phối subagent cần thiết để gọi addon SimReady Blender, addon này được sử dụng để xác thực cảnh trên các profile SimReady mục tiêu. Nếu xác thực báo cáo bất kỳ lỗi nào, agent sẽ đánh dấu để con người xem xét trước khi tiếp tục.
Hình 9. NemoClaw đang điều phối subagent cần thiết để gọi addon SimReady Blender
Bắt đầu chuẩn bị các cảnh 3D cho mô phỏng
Huấn luyện robot không bắt đầu khi chính sách (policy) được chạy. Nó bắt đầu khi thế giới đã sẵn sàng, điều này đòi hỏi nhiều hơn một cảnh nhìn đẹp mắt. Nó yêu cầu một thế giới USD có nhãn ngữ nghĩa, vật liệu nhận biết mô phỏng, cảm biến, thuộc tính vật lý, kiểm tra trước hình ảnh (visual preflight) và xác thực so với hồ sơ mục tiêu. Đó là quá nhiều công việc ghép nối tẻ nhạt để giao hoàn toàn cho con người, và quá cụ thể để giải quyết chỉ bằng các câu lệnh (prompts).
Mô hình hữu ích là một tập hợp các subagent với các công cụ thực tế:
Blender MCP inspects the scene. Omniverse Libraries author the world. USD carries the contract. Semantic labels add meaning. Sensors define perception. ovphysx makes it physical. ovrtx makes it visually testable. SimReady validation makes it acceptable. Isaac Sim / Isaac Lab makes it trainable.
Hướng đi tiếp theo là kỹ thuật agentic với các công cụ thực tế: Codex hoặc Claude để điều phối, NemoClaw để phối hợp các subagent, và NVIDIA Omniverse Libraries để cho phép các agent này tác động lên cảnh.
Các hệ thống được đề xuất bao gồm:
- NVIDIA DGX Spark: Lý tưởng cho việc tạo mẫu cục bộ, với 128 GB bộ nhớ hệ thống thống nhất liên tục. Sử dụng nó để phát triển các subagent NemoClaw, kết nối với Blender thông qua MCP, soạn thảo USD, chạy xác thực SimReady và kiểm tra các vòng lặp ovrtx hoặc ovphysx từ một hệ thống máy tính để bàn.
- NVIDIA DGX Station: Siêu máy tính AI để bàn tối ưu, được trang bị chip siêu máy tính để bàn NVIDIA GB300 Grace Blackwell Ultra với bộ nhớ đồng nhất lên đến 748 GB, phục vụ phát triển AI, suy luận và các quy trình làm việc tác nhân tại chỗ, có thể cấu hình thêm GPU NVIDIA RTX PRO 6000 Blackwell Generation Workstation. Sử dụng khi các phân cảnh ngày càng lớn, mô hình cục bộ cần nhiều bộ nhớ hơn, nhiều tác nhân phụ chạy song song hơn, hoặc các tải trọng mô phỏng và trực quan hóa trở nên phức tạp hơn.
- NVIDIA RTX PRO Servers: Lựa chọn tối ưu cho các quy trình làm việc quy mô nhóm. Sử dụng cho các quy trình làm việc tác nhân chia sẻ, chuẩn bị phân cảnh hàng loạt, tài sản OpenUSD quy mô lớn, tạo dữ liệu tổng hợp và các lần chạy xác thực theo phong cách sản xuất.
- NVIDIA DGX Cloud: Tốt nhất cho phát triển quy mô đám mây. Sử dụng khi quy trình làm việc cần khả năng tính toán linh hoạt cho các tác vụ huấn luyện lớn, mô phỏng theo lô, hoặc các đường dẫn AI vật lý mở rộng vượt quá phần cứng cục bộ.
Sẵn sàng bắt đầu? Chọn một nút thắt trong quá trình chuẩn bị cảnh, giao nó cho một phụ trợ (subagent), kết nối nó với một công cụ Omniverse, và thêm một cổng xác thực.
Để tìm hiểu thêm, hãy xem các tài nguyên sau:
- Duyệt thêm các mẫu Omniverse trên repo GitHub của Omniverse Labs
- Khám phá Thư viện NVIDIA Omniverse để tìm các công cụ có thể gọi bằng agent trên các lĩnh vực USD, rendering, vật lý, lưu trữ và xác thực
- Thử nghiệm SimReady Foundation để hiểu rõ các hồ sơ xác thực và yêu cầu đối với USD sẵn sàng cho mô phỏng
- Xây dựng hướng tới Isaac Lab hoặc Isaac Sim cho việc học máy robot
- Tìm hiểu cách NemoClaw giúp xây dựng các tác nhân chuyên biệt.
- Trở thành nhà phát triển OpenUSD và tìm hiểu nền tảng của các quy trình làm việc 3D dựa trên tác nhân.
Tham gia cùng đội ngũ NVIDIA vào lúc 11:00 sáng giờ Thái Bình Dương ngày 30 tháng 9 tại OpenUSD Insider Livestream: Phát triển Mô phỏng Physical AI Trực tiếp với GPT-6 Astra và Thư viện NVIDIA Omniverse.
Bài viết liên quan
- Xây dựng Agent dựa trên bộ nhớ với NVIDIA NemoClaw
- Tạo quỹ đạo, dấu vết lập luận và nhãn tự động với NVIDIA Alpamayo 2 Super
- Mở rộng khả năng nhận diện trên các nền tảng AV với NVIDIA Omniverse NuRec
- TensorRT 11 có gì mới và AI Engineer cần chuẩn bị gì khi nâng cấp?
- Tại sao việc mở rộng hiệu suất điện toán AI đòi hỏi một kiến trúc nguồn điện mới?
