Dùng AI kiểm thử và kiểm thử hệ thống AI: hai nghề khác nhau
Tóm tắt: Dùng AI để kiểm thử và kiểm thử một hệ thống AI là hai công việc khác nhau, đòi hai bộ kỹ năng khác nhau. ISTQB đã tách chính thức: CT-GenAI dành cho người dùng AI như trợ lý kiểm thử, CT-AI v2.0 dành cho người kiểm thử chính bản thân hệ thống AI.
Mục lục
- Vì sao hai khái niệm này bị gộp làm một?
- ISTQB đã tách hai lĩnh vực này như thế nào?
- AI for Testing (CT-GenAI): AI làm trợ lý cho kiểm thử
- Testing AI Systems (CT-AI v2.0): sản phẩm cần kiểm thử là một hệ thống AI
- Vì sao không thể giao cho AI việc kiểm thử một AI khác?
- QA Manager nên bố trí kỹ năng cho đội thế nào?
- Khi nào đội của bạn chưa cần đến CT-AI?
- Câu hỏi thường gặp
1. Vì sao hai khái niệm này bị gộp làm một?
Cụm từ "kiểm thử AI" trong tiếng Việt che mất một sự khác biệt quan trọng: nó vừa có nghĩa "dùng AI để kiểm thử", vừa có nghĩa "kiểm thử một sản phẩm AI". Hai nghĩa này mô tả hai công việc gần như không liên quan nhau.
Trong các buổi trao đổi với đội QA phía khách hàng, chúng tôi thường gặp mẫu hình sau. Một kỹ sư nói đội mình "đã làm kiểm thử AI rồi", và khi hỏi cụ thể thì hoá ra đội đang dùng ChatGPT để sinh code Selenium. Đó là một việc hữu ích, nhưng nó không nói gì về năng lực kiểm thử một chatbot, một AI Agent hay một hệ thống RAG (Retrieval-Augmented Generation — sinh câu trả lời dựa trên tài liệu truy xuất được).
Sự nhầm lẫn này gây hậu quả thật khi tuyển dụng và khi phân công. Một QA Manager tuyển "kỹ sư có kinh nghiệm AI" để nhận dự án kiểm thử chatbot, rồi phát hiện ứng viên chỉ biết dùng Copilot viết test script. Ngược lại, một đội có người thật sự hiểu đánh giá mô hình lại bị giao đi viết automation thông thường.
2. ISTQB đã tách hai lĩnh vực này như thế nào?
Tổ chức Kiểm thử Phần mềm Quốc tế (ISTQB — International Software Testing Qualifications Board) đã tách hai lĩnh vực này thành hai chứng chỉ riêng biệt, và việc tách hoàn tất trong năm 2026.
Tháng 4/2026, ISTQB công bố syllabus Certified Tester AI Testing (CT-AI) phiên bản 2.0 — bản viết lại lớn đầu tiên kể từ 2021. Điểm quan trọng nhất của bản này không phải phần thêm vào, mà là phần bị lấy đi: toàn bộ nội dung về dùng AI để hỗ trợ kiểm thử đã được gỡ khỏi CT-AI (ISTQB, syllabus CT-AI v2.0, 4/2026). CT-AI v2.0 giờ chỉ còn nói về kiểm thử chính bản thân hệ thống AI.
Phần bị gỡ đi có chỗ đứng riêng: Certified Tester – Testing with Generative AI (CT-GenAI), được Đại hội đồng ISTQB phê duyệt ngày 25/7/2025, hiện ở phiên bản 1.1. Chứng chỉ này nói về prompt engineering, giới hạn của mô hình ngôn ngữ lớn, và cách đưa AI vào hạ tầng kiểm thử.
| CT-GenAI | CT-AI v2.0 | |
|---|---|---|
| Câu hỏi trung tâm | Dùng AI để kiểm thử tốt hơn thế nào? | Kiểm thử một hệ thống AI thế nào? |
| Đối tượng kiểm thử | Phần mềm thông thường | Hệ thống AI (chatbot, AI Agent, RAG, mô hình ML) |
| AI đóng vai | Công cụ trong tay kiểm thử viên | Sản phẩm bị đưa lên bàn kiểm thử |
| Nội dung chính | Prompt engineering, rủi ro ảo giác và thiên lệch, hạ tầng kiểm thử có AI | Kiểm thử dữ liệu đầu vào, kiểm thử mô hình, đặc tính chất lượng AI theo ISO/IEC 25059 |
| Điều kiện dự thi | ISTQB Foundation Level (CTFL) | ISTQB Foundation Level (CTFL) |
| Định dạng thi | 40 câu, 60 phút | 40 câu, 60 phút, đạt 29/44 điểm |
CT-AI v1.0 sẽ ngừng phát hành: bản tiếng Anh còn dùng đến 21/4/2027, các bản ngôn ngữ khác đến 21/10/2027 (ISTQB, trang chứng chỉ CT-AI). Đội nào đang có người học dở CT-AI v1.0 nên biết mốc này khi lập kế hoạch đào tạo.
3. AI for Testing (CT-GenAI): AI làm trợ lý cho kiểm thử
Nhánh AI for Testing dùng AI như một trợ lý trong quy trình kiểm thử phần mềm thông thường. Ba ứng dụng đang được triển khai rộng nhất:
- Sinh test case từ yêu cầu. AI đọc tài liệu đặc tả và đề xuất bộ kịch bản kiểm thử. Giá trị thật nằm ở tốc độ có bản nháp đầu tiên, không nằm ở chất lượng bản nháp đó.
- Tổng hợp dữ liệu thử nghiệm (synthetic data). AI sinh dữ liệu mẫu đủ đa dạng để phủ các nhánh xử lý, đặc biệt hữu ích khi dữ liệu thật chứa thông tin cá nhân không được đưa vào môi trường test.
- Tự phục hồi kịch bản (self-healing). Khi giao diện thay đổi làm selector hỏng, công cụ tự tìm phần tử tương ứng và cập nhật kịch bản thay vì báo lỗi.
Self-healing là chỗ cần nói thẳng về giới hạn. Cơ chế này sửa được kịch bản hỏng do giao diện thay đổi, nhưng nó không phân biệt được giữa "nút Đăng ký đổi id" và "nút Đăng ký bị xoá nhầm khỏi sản phẩm". Ở trường hợp thứ hai, việc tự phục hồi thành công chính là việc che mất một lỗi thật. Một bộ test tự phục hồi quá tốt có thể xanh toàn tập trong khi sản phẩm đã hỏng.
Vì vậy, nguyên tắc vận hành đi kèm self-healing là: mọi lần tự sửa đều phải ghi log và được người rà soát định kỳ. Tự phục hồi âm thầm, không để lại dấu vết, là một rủi ro chứ không phải một tính năng.
4. Testing AI Systems (CT-AI v2.0): sản phẩm cần kiểm thử là một hệ thống AI
Nhánh Testing AI Systems xử lý tình huống sản phẩm bị kiểm thử là chatbot, AI Agent, hệ thống RAG hoặc mô hình học máy. Ở đây, giả định nền tảng của kiểm thử truyền thống bị phá vỡ: cùng một đầu vào không còn cho ra cùng một đầu ra, nên câu lệnh khẳng định dạng assertEquals mất tác dụng.
CT-AI v2.0 tổ chức công việc quanh hai cấp kiểm thử riêng của hệ thống học máy, cộng với một lớp đặc tính chất lượng:
Kiểm thử dữ liệu đầu vào (input data testing). Dữ liệu là thứ quyết định hành vi mô hình, nên nó phải được kiểm thử như một thành phần phần mềm: dữ liệu có đại diện cho thực tế sử dụng không, nhãn có đúng không, có thiên lệch nào bị nhân lên không, đường ống nạp dữ liệu có làm hỏng dữ liệu không.
Kiểm thử mô hình (model testing). Đánh giá chính mô hình bằng các kỹ thuật không có trong kiểm thử truyền thống: kiểm thử biến thái (metamorphic testing — kiểm tra quan hệ giữa các đầu ra thay vì kiểm tra một đầu ra tuyệt đối), kiểm thử đối kháng, phát hiện trôi dạt mô hình theo thời gian, và đối chiếu song song giữa hai phiên bản.
Đặc tính chất lượng AI. CT-AI v2.0 neo phần này vào tiêu chuẩn ISO/IEC 25059 — mở rộng của bộ tiêu chuẩn chất lượng phần mềm cho hệ thống AI, bao gồm các đặc tính như tính bền vững, tính minh bạch và khả năng giải thích.
Đây là phần chúng tôi làm trực tiếp trên sản phẩm của mình. VAON phát triển và vận hành OneBot — trợ lý hội thoại theo kiến trúc RAG, tích hợp LINE, đang chạy production. Khi kiểm thử OneBot, phần khó nhất không phải là các luồng hội thoại chính, mà là dựng được một bộ tiêu chí đánh giá cho câu trả lời không cố định: câu trả lời đúng nghiệp vụ nhưng diễn đạt khác nhau thì tính đạt hay không đạt, và ngưỡng nào thì coi là mô hình đang bịa. Không có câu lệnh khẳng định nào diễn đạt được yêu cầu đó. Chúng tôi phải xây bộ dữ liệu đánh giá riêng kèm tiêu chí chấm điểm do người định nghĩa — đúng loại công việc mà CT-AI v2.0 mô tả, và là loại công việc mà một kỹ sư automation giỏi chưa từng làm bao giờ.
5. Vì sao không thể giao cho AI việc kiểm thử một AI khác?
Giao cho một hệ thống AI việc đánh giá một hệ thống AI khác tạo ra một vòng lặp không có điểm neo: cả bên bị kiểm thử lẫn bên kiểm thử đều có thể sai theo cùng một kiểu, và không thành phần nào trong vòng lặp phát hiện được điều đó.
Vấn đề không phải là mô hình chấm điểm kém. Vấn đề là mô hình chấm điểm chia sẻ với mô hình bị chấm cùng những điểm mù: cùng dữ liệu huấn luyện phổ biến, cùng xu hướng ưu tiên câu trả lời trôi chảy hơn câu trả lời đúng, cùng thiên lệch với các cách diễn đạt quen thuộc. Một câu trả lời sai nhưng trình bày trôi chảy có khả năng được cả hai bên cùng chấp nhận.
Điều đó không có nghĩa là bỏ hoàn toàn việc dùng mô hình để chấm điểm. Nó có nghĩa là kiến trúc kiểm thử phải lai (hybrid), với ba lớp:
- Lớp xác định được. Các kiểm tra có đúng/sai rõ ràng: định dạng đầu ra, thời gian phản hồi, có trích dẫn nguồn hay không, có rò rỉ dữ liệu cá nhân không. Tự động hoá hoàn toàn.
- Lớp mô hình chấm mô hình. Dùng để sàng nhanh trên khối lượng lớn, chấp nhận sai số, không bao giờ dùng làm căn cứ phát hành.
- Lớp người quyết định. Người định nghĩa tiêu chí đạt, rà soát mẫu ngẫu nhiên từ lớp 2, và quyết định phát hành. Đây là chốt chặn cuối cùng và nó không được uỷ quyền cho công cụ.
Tỉ lệ giữa ba lớp thay đổi theo mức rủi ro của sản phẩm. Một chatbot nội bộ tra cứu quy trình khác hoàn toàn một trợ lý tư vấn sản phẩm cho khách hàng cuối, dù về mặt kỹ thuật cả hai đều là RAG.
6. QA Manager nên bố trí kỹ năng cho đội thế nào?
Cách bố trí hợp lý phụ thuộc vào việc đội của bạn đang kiểm thử cái gì, không phụ thuộc vào việc công ty có đang nói về AI hay không.
| Tình huống của đội | Ưu tiên | Lý do |
|---|---|---|
| Kiểm thử phần mềm thông thường, muốn tăng tốc | CT-GenAI cho phần lớn đội | Giá trị đến ngay ở năng suất hằng ngày |
| Sắp nhận dự án chatbot / AI Agent / RAG | CT-AI v2.0 cho ít nhất 1–2 người | Thiếu người hiểu đánh giá mô hình thì không nhận được dự án |
| Đã có sản phẩm AI chạy production | CT-AI v2.0, ưu tiên người nắm nghiệp vụ | Tiêu chí đánh giá phải do người hiểu nghiệp vụ định nghĩa |
| Đội nhỏ, một người kiêm nhiệm | CT-GenAI trước, CT-AI khi có dự án thật | Học chứng chỉ không có dự án đi kèm thì kiến thức rơi rụng nhanh |
Một lưu ý về tuyển dụng: khi mô tả công việc, hãy viết rõ đối tượng kiểm thử thay vì viết "kinh nghiệm AI". "Kiểm thử hệ thống RAG, xây bộ tiêu chí đánh giá đầu ra không cố định" lọc ứng viên chính xác hơn nhiều so với "ưu tiên ứng viên có kinh nghiệm AI".
7. Khi nào đội của bạn chưa cần đến CT-AI?
Nếu sản phẩm của bạn không chứa thành phần AI nào, CT-AI v2.0 chưa mang lại giá trị thực tế cho đội. Kiểm thử dữ liệu đầu vào và kiểm thử mô hình là kỹ năng chỉ dùng được khi có mô hình để kiểm thử.
Tương tự, nếu đội chưa có quy ước kiểm thử thành văn, chưa có bộ test hồi quy ổn định, thì việc đưa AI vào — theo cả hai nhánh — sẽ khuếch đại sự lộn xộn sẵn có thay vì giải quyết nó. Nền tảng quy trình phải có trước công cụ. Chúng tôi đã bàn kỹ thứ tự này trong bài về vòng lặp bốn bước và điểm kiểm chứng khi dùng AI trong kiểm thử.
8. Câu hỏi thường gặp
Kỹ sư QA nên học CT-GenAI hay CT-AI v2.0 trước? Phụ thuộc vào sản phẩm đang kiểm thử. Nếu sản phẩm không có thành phần AI, học CT-GenAI trước vì nó áp dụng được ngay vào công việc hằng ngày. Nếu đội sắp hoặc đang kiểm thử chatbot, AI Agent hay hệ thống RAG, CT-AI v2.0 là chứng chỉ đúng, và nên có ít nhất một người trong đội đạt được trước khi dự án bắt đầu.
Đã có CT-AI v1.0 thì có cần học lại v2.0 không? CT-AI v2.0 là bản viết lại lớn đầu tiên kể từ 2021, với cấu trúc và trọng tâm khác v1.0, nên chứng chỉ cũ không phản ánh nội dung mới. ISTQB cũng đã công bố lộ trình ngừng phát hành v1.0: bản tiếng Anh đến 21/4/2027, các bản ngôn ngữ khác đến 21/10/2027.
Dùng ChatGPT viết test script có phải là kiểm thử AI không? Không. Đó là dùng AI để hỗ trợ kiểm thử, thuộc phạm vi CT-GenAI. Kiểm thử AI có nghĩa đối tượng bị kiểm thử là một hệ thống AI, đòi kỹ thuật khác hẳn như kiểm thử dữ liệu đầu vào, kiểm thử biến thái và đánh giá đầu ra không cố định.
Có thể dùng một mô hình ngôn ngữ để chấm điểm đầu ra của mô hình khác không? Có thể dùng để sàng nhanh trên khối lượng lớn, nhưng không được dùng làm căn cứ quyết định phát hành. Mô hình chấm điểm chia sẻ điểm mù với mô hình bị chấm, nên một câu trả lời sai nhưng trôi chảy có thể được cả hai cùng chấp nhận. Người vẫn phải định nghĩa tiêu chí đạt và rà soát mẫu.
Kiểm thử hệ thống RAG khác kiểm thử chatbot thông thường ở điểm nào? Hệ thống RAG có thêm một tầng cần kiểm thử độc lập: tầng truy xuất tài liệu. Một câu trả lời sai có thể do mô hình sinh sai, hoặc do tầng truy xuất lấy về đúng tài liệu nhưng không liên quan. Hai nguyên nhân này cần bộ kiểm thử tách riêng, nếu gộp lại sẽ không định vị được lỗi nằm ở đâu.
Bộ tiêu chí đánh giá đầu ra AI nên do ai xây? Người nắm nghiệp vụ, không phải người nắm công cụ. Việc quyết định một câu trả lời là đạt hay không đạt là quyết định nghiệp vụ, không phải quyết định kỹ thuật. Kỹ sư kiểm thử dựng cơ chế chạy và đo; người hiểu nghiệp vụ định nghĩa thế nào là đúng.
Kết & bước tiếp theo
Hai nhánh nghề này sẽ tiếp tục tách xa nhau, không hội tụ lại. Dùng AI để kiểm thử là kỹ năng nâng năng suất, sẽ trở thành mặc định trong vài năm tới. Kiểm thử hệ thống AI là chuyên môn riêng, và hiện số người làm được vẫn ít hơn số dự án cần.
Với QA Manager, việc cần làm trước mắt không phải là chọn chứng chỉ, mà là trả lời một câu hỏi: sản phẩm mà đội đang chịu trách nhiệm có chứa thành phần AI không, và nếu có thì ai trong đội đang định nghĩa tiêu chí đạt cho đầu ra của nó. Nếu chưa có ai, đó là khoảng trống cần lấp trước khi tính đến đào tạo.
VAON kiểm thử hệ thống AI trên chính sản phẩm của mình và trên dự án của khách hàng Nhật Bản. Nếu đội của bạn đang chuẩn bị nhận một dự án AI, chúng tôi cung cấp buổi Audit quy trình QA và kiến trúc hệ thống miễn phí, dựa trên kinh nghiệm phát triển hệ thống và tư vấn chuyển đổi số.
Nguồn tham khảo
- ISTQB. ISTQB Releases Certified Tester AI Testing (CT-AI) Syllabus Version 2.0. Tháng 4/2026. https://istqb.org/istqb-releases-certified-tester-ai-testing-ct-ai-syllabus-version-2-0/
- ISTQB. Certified Tester AI Testing (CT-AI) Version 2.0 — trang chứng chỉ (business outcomes, điều kiện dự thi, mốc ngừng phát hành v1.0). https://istqb.org/certifications/certified-tester-ai-testing-ct-ai/
- ISTQB. Certified Tester Specialist Level – Testing with Generative AI (CT-GenAI) — trang chứng chỉ (phê duyệt 25/7/2025, phiên bản 1.1). https://istqb.org/certifications/gen-ai/