Human-in-the-loop trong AI Agent là phương pháp thiết kế quy trình làm việc để con người vẫn giữ quyền kiểm tra hoặc quyết định tại những điểm quan trọng thay vì để agent tự động thực hiện toàn bộ. Các điểm kiểm soát thường cần xem xét bao gồm dữ liệu đầu vào, quyền truy cập, chất lượng kết quả, quyết định chạy lại và hành động bàn giao ra bên ngoài.
Trong OpenAI Agents SDK, human-in-the-loop có thể được áp dụng bằng cách tạm dừng quá trình chạy trước một thao tác nhạy cảm, yêu cầu con người phê duyệt hoặc từ chối trước khi tiếp tục. Trạng thái dừng này có thể được lưu lại và tiếp tục sau khi có quyết định.
Tư duy này cũng được thể hiện rõ trong PD P2.1 Brain Engineer – Non-IT Track của FUNiX: assistant có thể hỗ trợ xử lý công việc, nhưng con người vẫn kiểm tra chất lượng, quyền riêng tư, bảo mật, chi phí và phê duyệt cuối cùng. Quy trình làm việc lặp lại còn cần có đầu vào, quy trình/kỹ năng, đầu ra, chứng cứ và sự phê duyệt của con người rõ ràng.
Điểm mấu chốt là human-in-the-loop không có nghĩa là con người phải duyệt tất cả các bước. Nếu mọi hành động nhỏ đều phải dừng lại để xin phép, quy trình làm việc sẽ mất phần lớn giá trị tự động hóa.
Thiết kế tốt hơn là xác định:
- Việc nào agent được tự thực hiện → Việc nào cần kiểm tra tự động → Việc nào bắt buộc phải dừng để con người quyết định.
Human-in-the-loop giữ vai trò của con người ở những điểm quan trọng trong quy trình AI Agent.
Human-in-the-loop là gì?

Human-in-the-loop, thường được viết tắt là HITL, là một mô hình mà trong đó con người được đưa vào vòng xử lý của hệ thống AI tại những điểm đã định trước.
Với AI Agent, điều này đặc biệt quan trọng vì agent không chỉ tạo văn bản mà còn có thể được cấp các công cụ để:
- Đọc file.
- Tra cứu dữ liệu.
- Gọi API.
- Chỉnh sửa nội dung.
- Chạy lệnh.
- Gửi thông tin.
- Thực hiện thay đổi trên hệ thống.
OpenAI hiện định nghĩa agent là ứng dụng có khả năng lập kế hoạch, gọi công cụ, phối hợp qua các chuyên gia và giữ trạng thái để hoàn thành công việc nhiều bước. Tài liệu cũng tách biệt guardrails và human review cho những quy trình cần chặn hoặc tạm dừng trước khi công việc rủi ro tiếp tục.
Do đó, khi agent có khả năng hành động thay mặt con người, câu hỏi an toàn không chỉ là:
- AI trả lời có đúng không?
Mà còn là:
- AI được phép truy cập gì, làm gì và hành động nào cần một người chịu trách nhiệm xác nhận?
Human approval khác guardrail như thế nào?

Hai khái niệm thường được sử dụng cùng nhau nhưng không giống nhau.
Guardrail là kiểm tra theo quy tắc
Guardrail có thể kiểm tra:
- Input có hợp lệ không.
- Output có vi phạm yêu cầu không.
- Tool call có dữ liệu bất thường không.
- Nội dung có vượt phạm vi agent không.
OpenAI Agents SDK hiện hỗ trợ input guardrails, output guardrails và tool guardrails. Input guardrail có thể chạy trước agent; output guardrail kiểm tra kết quả cuối cùng; tool guardrail có thể kiểm tra trước hoặc sau mỗi lần gọi công cụ tùy chỉnh.
Ví dụ:
- Nếu file đầu vào chứa loại dữ liệu không được phép xử lý → chặn lại.
Đây có thể là kiểm tra tự động.
Human approval là quyết định của con người
Ví dụ:
- Agent đã soạn email gửi 2.000 khách hàng. Có được gửi không?…
