Mỗi khi AI làm việc không như ý, phản xạ khá tự nhiên là:
Đổi model.
Model này reasoning chưa ngon? Đổi con mạnh hơn. Code hơi ngu? Lên bản Pro. Agent chạy sai? Chắc model chưa đủ thông minh.
API bill tăng thì… chuyện của tương lai.
Nhưng research gần đây gợi ý một khả năng hơi khó chịu:
Có khi model không phải thứ cần nâng cấp trước.
Có động cơ khỏe chưa chắc đã cày được ruộng
Hãy tưởng tượng bạn có một con máy cày 500 mã lực.
Động cơ khỏe. Công nghệ mới. Benchmark máy cày top 1 thế giới.
Nhưng tay lái lệch, lưỡi cày lắp sai, người lái không nhìn thấy luống, đi nhầm cũng chẳng ai báo.
Giải pháp của chúng ta là gì?
Mua con 700 mã lực.
Nghe hơi ngu, nhưng với AI chúng ta làm chuyện tương tự khá thường xuyên.
Bởi một AI agent không chỉ có model.
Bao quanh model còn có context, tools, retrieval, memory, permissions, state, retry, validation, feedback loop, cách agent gọi tool và cách nó phục hồi khi làm sai.
Đống đó thường được gọi chung là harness.
Paper Harness-Bench năm 2026 thử nhiều cấu hình model–harness trên 106 task với tổng cộng 5.194 execution trajectories. Kết quả cho thấy completion rate, efficiency và cả kiểu agent thất bại thay đổi đáng kể theo cặp model + harness. Nhóm tác giả cho rằng capability của agent nên được đánh giá ở cấp model–harness thay vì chỉ nhìn base model.
Nói đơn giản:
Model là động cơ. Harness là phần biến sức mạnh của động cơ thành công việc.
Cái thú vị là: model nhỏ đôi khi thắng model lớn
Paper AutoHarness có một ví dụ khá buồn cười.
Trong dữ liệu từ một cuộc thi chess mà nhóm tác giả phân tích, 78% trận thua của Gemini 2.5 Flash liên quan đến nước đi không hợp lệ.
Không phải cứ reasoning thêm 20 bước là giải quyết được.
Nó đang… đi sai luật.
Nhóm nghiên cứu để Gemini 2.5 Flash tự xây một code harness nhằm kiểm soát action. Harness tạo ra đã loại bỏ illegal moves trong 145 game của TextArena, và trong các thử nghiệm của paper, Gemini 2.5 Flash + harness có thể vượt Gemini 2.5 Pro.
Tức là đôi khi:
Thằng lái máy 50 mã lực đi đúng luống vẫn hơn ông 200 mã lực đang cày sang ruộng nhà hàng xóm.
Và đây không chỉ là chuyện benchmark
Paper Better Harnesses, Smaller Models đi thẳng vào bài toán tiền.
Các tác giả thử thích nghi harness cho những small language model trên các tác vụ business. Harness được cải thiện bằng instruction, tools và orchestration phù hợp với từng failure mode.
Kết quả: harness tối ưu cải thiện đáng kể 16/21 cặp task–model. Có 7 trường hợp model nhỏ đóng được khoảng cách hiệu năng với model lớn; trường hợp tốt nhất đạt 89,7% performance với chỉ 4% chi phí.
Ý đáng chú ý nhất của paper không phải con số 4%.
Mà là:
Một phần độ khó của bài toán có thể được chuyển từ model sang hệ thống bao quanh model.
Thay vì bắt model tự nhớ mọi thứ, cho nó memory tốt hơn.
Thay vì bắt model đoán cách sử dụng API, thiết kế tool rõ hơn.
Thay vì nhét cả cái database vào context rồi cầu nguyện, retrieve đúng thông tin khi cần.
Thay vì agent sai rồi tiếp tục sai thêm 12 bước, cho nó feedback và recovery loop.
Ngay từ SWE-agent năm 2024, các nhà nghiên cứu cũng đã cho thấy việc thiết kế một Agent-Computer Interface phù hợp có thể tác động rõ rệt đến cách language model agent làm việc với repository, file và test.
OpenAI gần đây cũng mô tả rất giống điều này từ kinh nghiệm thực tế khi build bằng Codex: tiến độ ban đầu chậm không hẳn vì model không đủ khả năng, mà vì environment còn thiếu tools, abstractions và structure. Công việc của engineer dần chuyển sang thiết kế môi trường và feedback loop để agent có thể làm việc đáng tin cậy.
Vậy lần tới agent làm ngu thì sao?
Đừng mặc định:
“Cần model mạnh hơn.”
Thử hỏi trước:
Retrieval có lấy đúng thứ nó cần không? Tool có dễ hiểu không? Context có toàn rác không? Agent có biết hành động vừa rồi thất bại không? Nó có cơ chế quay lại sửa sai không? Có eval để biết chính xác nó đang chết ở bước nào không?
Model mạnh vẫn rất quan trọng.
Nhưng model mạnh không tự động tạo ra một hệ thống mạnh.
Trước khi mua con máy cày 700 mã lực, có lẽ nên kiểm tra xem…
vô-lăng có đang nối với bánh xe không đã.
Đọc thêm
References
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows — 2026.
- AutoHarness: improving LLM agents by automatically synthesizing a code harness — 2026.
- Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation — 2026.
- SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering — 2024.