Chi phí cho AI Agent không chỉ đến từ một lần gọi model. Một quy trình có thể gửi context dài, gọi nhiều công cụ, sinh ra kết quả không cần thiết và thực hiện lại khi có lỗi; tất cả những điều này đều làm gia tăng số token và số lượng yêu cầu. Vì thế, để tối ưu chi phí, cần nhìn vào toàn bộ vòng đời của một tác vụ thay vì chỉ tìm model có giá rẻ hơn.
Direct Answer

Để tối ưu chi phí vận hành AI Agent mà vẫn giữ chất lượng, hãy:
- Giảm context không cần thiết
- Sử dụng model phù hợp cho từng bước
- Giới hạn định dạng đầu ra
- Tận dụng prompt cache
- Kiểm soát retry
- Ghi log token theo từng request
Mọi thay đổi nên được so sánh bằng cùng một bộ test trước và sau.
Chi phí AI Agent phát sinh ở đâu?
Một Agent đơn giản có thể chỉ gọi model một lần. Nhưng trong thực tế, Agent thường hoạt động theo chuỗi:
User request → context → model → tool → model → output
Nếu Agent tự lập kế hoạch, tra cứu dữ liệu hoặc sửa kết quả, một yêu cầu từ người dùng có thể tạo ra nhiều lần gọi API. Chi phí cơ bản thường gồm:
- Input token
- Cached input hoặc cache write nếu nền tảng hỗ trợ
- Output token
- Các lần gọi model bổ sung
- Công cụ hoặc dịch vụ có tính phí
- Yêu cầu phát sinh do retry
Với OpenAI API hiện tại, giá còn thay đổi theo model, độ dài context và chế độ xử lý. Ví dụ, tài liệu pricing phân biệt input, cached input, cache write và output; với context dài, mức giá của một số model cũng cao hơn context ngắn. Do đó, câu hỏi hữu ích không phải chỉ là “model nào rẻ nhất?”, mà là mỗi tác vụ đang tiêu tiền vào phần nào?
Checklist tối ưu chi phí AI Agent

| Hạng mục | Dấu hiệu lãng phí | Cách tối ưu |
|---|---|---|
| Context | Prompt ngày càng dài | Chỉ gửi dữ liệu cần cho lượt hiện tại |
| Model | Mọi bước dùng model mạnh nhất | Phân tầng model theo độ khó |
| Output | Câu trả lời dài ngoài nhu cầu | Định nghĩa format và giới hạn output |
| Cache | System prompt/tool lặp lại | Giữ prefix ổn định để tái sử dụng cache |
| Tool | Agent gọi công cụ quá nhiều | Đặt điều kiện gọi tool rõ ràng |
| Retry | Lỗi là gọi lại toàn workflow | Retry có giới hạn, chỉ retry lỗi phù hợp |
| Log | Chỉ biết tổng hóa đơn | Ghi token, model, tool và số lần gọi |
| Evaluation | Giảm chi phí nhưng không đo chất lượng | So sánh cùng một bộ test trước/sau |
1. Giảm context trước khi đổi model
Context thường là nơi dễ phát sinh token dư thừa nhất.
Agent có thể được gửi cả lịch sử hội thoại, tài liệu dài, output cũ, định nghĩa tool và hướng dẫn hệ thống ở mỗi request. Context càng tăng, input token càng lớn.
Trước khi gửi request, nên phân loại dữ liệu thành ba nhóm:
- Context bắt buộc: Thông tin model cần để hoàn thành tác vụ hiện tại.
- Context có thể truy xuất khi cần: Không phải toàn bộ knowledge base cần nằm trong prompt.
- Context có thể loại bỏ: Các đoạn hội thoại cũ không còn ảnh hưởng đến nhiệm vụ nên được bỏ khỏi request.
Một nguyên tắc thực tế là: mỗi phần context phải trả lời được câu hỏi “model cần thông tin này để quyết định điều gì?” Nếu không có câu trả lời rõ ràng, đó là ứng viên để cắt giảm.
2. Không dùng model mạnh nhất cho mọi bước

Một AI workflow thường chứa cả tác vụ khó lẫn tác vụ đơn giản.
- Phân loại yêu cầu.
- Trích xuất trường dữ liệu.
- Chọn tool.
- Tóm tắt kết quả.
- Lập luận cho trường hợp phức tạp.
Không phải bước nào cũng cần cùng một model.
Tài liệu model selection của OpenAI khuyến nghị đặt mục tiêu accuracy trước, sau đó tìm model rẻ và nhanh nhất vẫn đạt ngưỡng chất lượng đó.
Có thể áp dụng mô hình phân tầng:
- Tác vụ đơn giản → model nhỏ
- Tác vụ khó hoặc rủi ro cao → model mạnh hơn
Ví dụ, việc phân loại một request vào năm nhóm cố định có thể được kiểm thử với model nhỏ. Chỉ các trường hợp không chắc chắn mới chuyển sang model mạnh hơn.
Điểm quan trọng là không downgrade model theo cảm tính. Hãy dùng cùng một test set để xác nhận chất lượng trước khi thay đổi.
3. Kiểm soát output token ngay từ thiết kế
Giảm input nhưng để Agent sinh ra output không cần thiết cũng gây lãng phí token.
