Các công việc trong doanh nghiệp bao gồm tin nhắn, quyết định, dự án và các nghĩa vụ thay đổi theo thời gian. Một AI agent bắt đầu tác vụ của nó mà không có ngữ cảnh này phải tái tạo lại nó trước khi thực hiện công việc.
Để cung cấp cho các tác nhân ngữ cảnh cần thiết này, nhóm của chúng tôi đã sử dụng NVIDIA NemoClaw để xây dựng một Trưởng phòng điều hành dựa trên bộ nhớ. Nó duy trì một lớp kiến thức dễ đọc dành cho con người được gọi là self model (mô hình tự thân): một bộ nhớ của tác nhân chứa thông tin về những người liên quan, dự án, ưu tiên và các mô hình làm việc. Các công việc được lên lịch định kỳ xem xét các hoạt động mới, theo dõi các nghĩa vụ và tích hợp các quyết định của người dùng theo thời gian. Kinh nghiệm của chúng tôi cho thấy rằng bộ nhớ tác nhân hữu ích đòi hỏi cấu trúc, truy xuất chọn lọc và quản trị—không chỉ đơn thuần là lưu trữ.
Bài viết này minh họa cách một tác nhân điều khiển bởi bộ nhớ, được xây dựng bằng NVIDIA NemoClaw, có thể cải thiện năng suất trong các quy trình làm việc doanh nghiệp thực tế. Bài viết cũng chia sẻ năm bài học thiết kế mà bạn có thể áp dụng cho các tác nhân của riêng mình:
- Duy trì ngữ cảnh xuyên suốt công việc hàng ngày để nâng cao chất lượng nhiệm vụ
- Tách biệt bằng chứng, kiến thức và hành động để giúp các tác nhân đưa ra các quyết định tốt hơn
- Thiết kế các tác nhân dựa trên bộ nhớ có thể ưu tiên ý định của người dùng hơn là sự khẩn cấp trước mắt
- Cho phép người dùng sửa đổi quyết định của tác tử để xây dựng lòng tin
- Thực thi ranh giới bảo mật và ủy quyền với NVIDIA OpenShell
Duy trì ngữ cảnh xuyên suốt công việc hàng ngày
Lịch sử hội thoại cung cấp tính liên tục ngắn hạn, nhưng nó trộn lẫn các ưu tiên hiện tại với các quyết định trong quá khứ và các yêu cầu tạm thời. Truy xuất có thể tìm thấy tài liệu nguồn liên quan, nhưng tác nhân vẫn phải kết nối thông tin xuyên suốt thời gian.
Hãy xem xét một câu hỏi về tình trạng dự án. Câu trả lời có thể phụ thuộc vào một quyết định trước đó, một sự sửa đổi trong một tin nhắn sau này, một nghĩa vụ chưa được giải quyết, và kiến thức rằng hai tên khác nhau đề cập đến cùng một dự án.
Để giải quyết những vấn đề này, bạn có thể sử dụng mô hình tự thân (self model) duy trì các mối quan hệ này trong các trang Markdown có cấu trúc. Nó tổ chức thông tin về con người, dự án, mức độ ưu tiên, mục tiêu, khái niệm và các mẫu công việc lặp lại. Schema của nó xác định việc lập chỉ mục, tham chiếu chéo, nguồn gốc và giới hạn tăng trưởng.
Mô hình tự thân lưu trữ một cách diễn giải suy ra thay vì thay thế bằng bằng chứng nguồn. Việc giữ hai phần riêng biệt giúp bạn, nhà phát triển, xác định xem câu trả lời sai đến từ bằng chứng, bảo trì bộ nhớ, truy xuất hay quyết định cuối cùng của mô hình.
Tách biệt bằng chứng, kiến thức và hành động
Bạn có thể sử dụng ba lớp khả năng tinh chỉnh từ Trợ lý Điều hành dựa trên bộ nhớ:
Bằng chứng → Kiến thức → Thực thi có kiểm soát
Các bằng chứng hỗ trợ việc cập nhật mô hình bản thân. Đối với mỗi nhiệm vụ, tác nhân sẽ truy xuất một tập hợp có giới hạn các ngữ cảnh liên quan. Sau đó, tác nhân sử dụng ngữ cảnh đó trong ví dụ NVIDIA NemoClaw. Kiến trúc được hiển thị trong Hình 1.
Hình 1. NVIDIA NemoClaw sử dụng ngữ cảnh liên tục để quản lý các hành động của tác nhân
Ví dụ này lưu trữ hai loại thông tin:
- Tri thức: Con người, dự án, ưu tiên và các mô hình làm việc
- Phán đoán: Liệu một mục có cần được chú ý, xếp hạng của nó ở đâu, và liệu người dùng có bỏ qua nó hay không
Bộ nhớ tác nhân Markdown lưu trữ kiến thức. Sổ cái SQLite lưu trữ các nghĩa vụ, xếp hạng, sửa đổi và sự kiện kiểm toán. Thiết kế này bảo toàn các phán đoán của tác nhân mà không ghi chúng vào các thông điệp nguồn dưới dạng cờ đã đọc, nhãn hoặc thư mục.
Một trang bộ nhớ có thể ghi lại rằng một cộng tác viên ưu tiên sử dụng Slack. Tác tử có thể sử dụng ngữ cảnh đó để đề xuất Slack, nhưng việc gửi tin nhắn vẫn phụ thuộc vào thông tin xác thực, quyền công cụ, chính sách thời gian chạy và sự phê duyệt của người dùng.
Ngữ cảnh có thể hỗ trợ cho một hành động, nhưng không thể ủy quyền cho hành động đó.
Ưu tiên ý định của người dùng hơn tính cấp bách trong ngắn hạn
Các yêu cầu đến thường tự mô tả là khẩn cấp, nhưng tính cấp bách không nhất thiết phản ánh ưu tiên của người dùng. Do đó, cổng kiểm tra ý định sẽ dành tầng cao nhất cho các nghĩa vụ liên quan đến những ưu tiên đã được người dùng nêu rõ.
Trong công thức công khai được cung cấp, một lời khai xác nhận chi tiêu khẩn cấp vẫn hiển thị nhưng xếp hạng thấp hơn một yêu cầu yên tĩnh hơn liên quan đến ưu tiên đã nêu. NVIDIA NemoClaw của bạn có thể diễn giải mối quan hệ đó, trong khi mã xác định thực thi kích thước tầng, hành vi tràn và thứ tự xếp hạng.
Cho phép người dùng sửa chữa tác nhân
Bộ nhớ bền vững có thể lưu giữ một phán đoán sai lầm dễ dàng như một phán đoán đúng. Sử dụng công thức này, bạn có thể di chuyển một nghĩa vụ sang một tầng khác hoặc bỏ qua nó, và các lần chạy tác tử sau đó sẽ lưu giữ quyết định đó. Mỗi thay đổi được ghi lại một lần trong một nhật ký kiểm toán chỉ ghi thêm.
Các mẫu hiệu chỉnh lặp lại có thể cập nhật một chính sách sở thích nhỏ, dễ đọc. Người dùng có thể kiểm tra, chỉnh sửa hoặc xóa chính sách đó thay vì để sở thích ẩn trong trạng thái của mô hình.
Vòng lặp phản hồi vẫn hiển thị:
Đánh giá của Agent → Sửa đổi của người dùng → Sự kiện kiểm toán → Cập nhật sở thích
Thêm bộ nhớ để cải thiện hiệu suất tác vụ của agent
Việc thêm Chief of Staff dựa trên bộ nhớ vào NemoClaw đã tạo ra những cải thiện có thể đo lường được trên nhiều tác vụ của agent, như được hiển thị trong Bảng 1. Agent Memory Benchmark và các ví dụ đánh giá được bao gồm trong repo ví dụ. Repo ví dụ này so sánh một baseline retrieval-augmented generation (RAG) agentic thực hiện truy xuất đa vòng với mô hình tự thân.
| Các chỉ số | Số lượng câu hỏi | Đường cơ sở RAG tác tử | Mô hình tự thân | Sự khác biệt |
|---|---|---|---|---|
| Độ chính xác tổng thể | 186 | 82,8% | 90,9% | +8,1 điểm phần trăm |
| Câu hỏi khó | 31 | 67,7% | 87,1% | +19,4 điểm phần trăm |
| Theo dõi các sự kiện thay đổi theo thời gian | 5 | 60,0% | 100,0% | +40,0 điểm phần trăm |
| Lập luận theo thời điểm | 6 | 33,3% | 66,7% | +33,3 điểm phần trăm |
| Giải quyết mơ hồ thực thể | 15 | 66,7% | 86,7% | +20,0 điểm phần trăm |
| Tổng hợp đa nguồn | 73 | 87,7% | 94,5% | +6,8 điểm phần trăm |
| Trả lời trung thực dựa trên Cơ sở dữ liệu | 13 | 100,0% | 92,3% | -7,7 điểm phần trăm |
| Tra cứu một bước | 30 | 86,7% | 83,3% | -3,3 điểm phần trăm |
| Phạm vi trích dẫn | 186 | 92,5% | 97,8% | +5,4 điểm phần trăm |
Bảng 1. Các chỉ số đánh giá cho mô hình cơ sở RAG tác nhân và mô hình tự thân trong kho lưu trữ ví dụ. Cả hai cấu hình đều sử dụng NVIDIA Nemotron 3 Ultra
Thực thi ranh giới tại thời điểm chạy
Sự tách biệt này được thực thi bằng NVIDIA NemoClaw và NVIDIA OpenShell, môi trường chạy bảo mật dành cho các tác nhân tự hành. NemoClaw tích hợp ví dụ này với NVIDIA OpenShell và quản lý vòng đời của nó, trong khi NVIDIA OpenShell chạy tác nhân trong một môi trường sandbox và cung cấp quản trị cũng như thực thi chính sách đối với quyền truy cập vào hệ thống tệp, tiến trình và mạng. Đối với suy luận được quản lý và các kết nối MCP, thông tin xác thực vẫn nằm ngoài môi trường sandbox.
Điều này rất quan trọng vì bộ nhớ và nội dung được truy xuất là đầu vào cho mô hình, chứ không phải là chính sách bảo mật đáng tin cậy. Nếu tác nhân diễn giải sai ngữ cảnh đó—hoặc làm theo các hướng dẫn độc hại—nó vẫn hoạt động trong các ranh giới môi trường chạy do nhà vận hành xác định. Chúng hạn chế quyền truy cập của tác nhân và tác động tiềm tàng của một sự cố.
Bắt đầu xây dựng bộ nhớ cho tác nhân
Để thích ứng thiết kế bộ nhớ được trình bày trong bài viết này cho ví dụ NemoClaw của riêng bạn, hãy xem xét công thức Trợ lý trưởng điều hành dựa trên bộ nhớ mã nguồn mở và đề xuất thiết kế của nó trong kho lưu trữ GitHub NVIDIA/nemoclaw-community.
Công thức đóng gói ví dụ dưới dạng hồ sơ Hermes có thể triển khai cho NemoClaw:
- Một lược đồ bộ nhớ có cấu trúc
- Sổ cái nghĩa vụ bền vững
- Logic xếp hạng bị giới hạn
- Đường dẫn sửa lỗi và kiểm toán của người dùng
- Bảo trì bộ nhớ theo lịch trình
- Tin nhắn tổng hợp và các trang bộ nhớ
- Hướng dẫn từng bước ngoại tuyến
- Một bộ các bài kiểm tra đơn vị
Các mẫu về con người, tổ chức, dự án và tin nhắn đều là do sáng tạo. Các quyết định của mô hình đã ghi lại thay thế cho quá trình suy luận trong hướng dẫn ngoại tuyến. Sau đó, mã sẽ áp dụng hành vi xếp hạng, hiệu chỉnh, lưu trữ và xác thực.
Công thức hiện tại tập trung vào nền tảng bộ nhớ. Nó không gửi tin nhắn hay sửa đổi các hệ thống nguồn. Phạm vi này cho phép bạn xem xét thiết kế mà không cần kết nối với tài khoản nơi làm việc. Các trình kết nối trực tiếp yêu cầu xử lý riêng biệt cho thông tin xác thực, quyền riêng tư, thời gian lưu trữ và xóa dữ liệu.
Tìm hiểu thêm về NVIDIA NemoClaw và NVIDIA OpenShell.
Bài viết liên quan
- Tạo quỹ đạo, dấu vết lập luận và nhãn tự động với NVIDIA Alpamayo 2 Super
- Mở rộng khả năng nhận diện trên các nền tảng AV với NVIDIA Omniverse NuRec
- TensorRT 11 có gì mới và AI Engineer cần chuẩn bị gì khi nâng cấp?
- Cách sử dụng AI Agents để chuẩn bị cảnh 3D cho mô phỏng
- Tại sao việc mở rộng hiệu suất điện toán AI đòi hỏi một kiến trúc nguồn điện mới?

