Khảo thí thích ứng: vì sao đề tự đổi độ khó cần một kho đã hiệu chuẩn, và điều đó nghĩa là gì với lớp học
Một bài thi bốn mươi câu đưa cho cả lớp. Em giỏi nhất làm mười câu đầu đã đúng hết và hai mươi câu dễ còn lại không nói thêm gì về em ấy. Em yếu nhất gặp mười lăm câu vận dụng cao ở cuối và cũng không nói thêm gì — em sai hết, nhưng ta không biết em đang ở mức nào.
Quản trị viên
19 tháng 9, 2026· 11 phút đọc

Một bài thi bốn mươi câu đưa cho cả lớp. Em giỏi nhất làm mười câu đầu đã đúng hết và hai mươi câu dễ còn lại không nói thêm gì về em ấy. Em yếu nhất gặp mười lăm câu vận dụng cao ở cuối và cũng không nói thêm gì — em sai hết, nhưng ta không biết em đang ở mức nào. Với cả hai em, phần lớn thời gian làm bài không tạo ra thông tin.

Nỗi khó: một đề cố định không thể vừa với cả lớp
Mọi thầy cô ra đề đều gặp một bài toán không có lời giải tốt: đề dễ thì không phân biệt được nhóm trên, đề khó thì nhóm dưới mất hết động lực và điểm dồn về một đầu. Tỷ lệ 4:3:3 giữa các mức độ là một cách dung hoà, và nó là cách dung hoà đúng cho một đề giấy — nhưng nó vẫn là dung hoà.
Câu hỏi mà hướng khảo thí thích ứng đặt ra khác đi: nếu đề không cần giống nhau cho mọi học sinh thì sao? Nếu sau mỗi câu, hệ thống ước lượng lại trình độ của em rồi chọn câu tiếp theo vừa với ước lượng đó?
Đây không phải ý tưởng mới hay chuyện tương lai. GMAT, GRE, bộ đo tăng trưởng MAP của NWEA và Duolingo English Test đều chạy theo cách này từ lâu. Nhưng nó có ba điều kiện, và hiểu ba điều kiện ấy quan trọng hơn hiểu thuật toán — vì chúng quyết định việc này dùng được ở đâu và không dùng được ở đâu.
Bản chất: đo bằng cách chọn câu gần với trình độ hiện tại
Nền lý thuyết là lý thuyết ứng đáp câu hỏi (Item Response Theory, IRT). Nó đổi cách nghĩ về điểm số theo một hướng đáng để nắm, dù không định làm đề thích ứng.
Trong cách tính điểm quen thuộc, điểm của học sinh là số câu đúng — tức mọi câu đáng giá như nhau. IRT nói: mỗi câu hỏi có một độ khó riêng, mỗi học sinh có một mức năng lực riêng, và xác suất em trả lời đúng một câu phụ thuộc vào khoảng cách giữa hai con số ấy. Trả lời đúng một câu khó nói nhiều hơn trả lời đúng một câu dễ, và phép tính điểm phản ánh điều đó.
Từ đó ra một hệ quả then chốt: một câu hỏi cho nhiều thông tin nhất khi độ khó của nó gần với năng lực của người làm. Câu quá dễ thì gần như chắc chắn đúng — biết trước kết quả thì không học thêm được gì. Câu quá khó thì gần như chắc chắn sai — cũng vậy. Câu mà em có khoảng một nửa cơ hội làm đúng là câu nói nhiều nhất.
Đề thích ứng làm đúng một việc: sau mỗi câu, ước lượng lại năng lực rồi chọn câu tiếp theo có độ khó gần ước lượng đó nhất. Vòng lặp dừng khi sai số của ước lượng xuống dưới một ngưỡng khai trước, hoặc khi hết số câu tối đa.
| Bước | Việc hệ thống làm |
|---|---|
| 1 | Bắt đầu bằng một câu độ khó trung bình |
| 2 | Ghi đúng/sai, ước lượng lại năng lực và sai số của ước lượng |
| 3 | Chọn câu kế tiếp có độ khó gần ước lượng mới nhất |
| 4 | Lặp lại cho tới khi sai số dưới ngưỡng, hoặc hết số câu tối đa |
| 5 | Báo về năng lực kèm sai số — không phải "đúng bao nhiêu câu trên bao nhiêu" |
Hiệu quả đo được của cách này khá nhất quán qua các hệ thống thật: cùng độ chính xác với khoảng một nửa số câu. Một bài bốn mươi câu cố định thay được bằng khoảng hai mươi câu thích ứng. Đó là một tiếng rưỡi tiết kiệm cho mỗi lớp mỗi kỳ.
Ba điều kiện, và điều kiện đầu là chỗ mọi kế hoạch vỡ
Một — kho câu phải được HIỆU CHUẨN. Thuật toán ở trên cần biết độ khó bằng số của từng câu. Không phải "đây là câu vận dụng cao" theo đánh giá của người soạn, mà một con số đo từ bài làm thật. Muốn có nó thì mỗi câu phải được hàng trăm học sinh làm qua, rồi từ dữ liệu ấy tính ra tham số.
Đây là điều kiện đắt nhất và hay bị bỏ qua nhất khi nói về đề thích ứng. Một kho mười nghìn câu chưa hiệu chuẩn thì không chạy thích ứng được, trong khi một kho ba trăm câu đã hiệu chuẩn thì chạy được. Số câu không phải thứ quyết định; dữ liệu về từng câu mới là.
Hai — mọi câu phải đo cùng MỘT chiều. IRT giả định có một trục năng lực duy nhất để xếp cả câu hỏi lẫn học sinh lên. Một kho trộn "năng lực đọc hiểu" với "năng lực tính toán" thì một con số duy nhất không mô tả được, và ước lượng trở nên vô nghĩa dù thuật toán vẫn chạy và vẫn trả về số.
Ba — học sinh không được quay lại sửa câu trước. Câu sau được chọn dựa trên câu trước, nên sửa câu trước là làm vô hiệu cả chuỗi lựa chọn sau đó. Điều này đổi hẳn trải nghiệm làm bài, và với học sinh nhỏ thì nó là một mất mát thật — chiến thuật "làm câu dễ trước, quay lại câu khó sau" không dùng được nữa.
Vì sao nó KHÔNG phù hợp bài kiểm tra 15 phút
Đây là phần cần nói rõ, vì hướng thích ứng hay được giới thiệu như thứ tốt hơn cho mọi hoàn cảnh.
Đề thích ứng đo một trục năng lực rộng: em đang ở đâu trên thang toán học nói chung. Còn bài kiểm tra 15 phút của thầy cô đo một nội dung hẹp vừa dạy: em có nắm hằng đẳng thức học tuần này không. Hai mục đích khác nhau tới mức hình thức của cái này sai với cái kia.
Với nội dung hẹp, câu hỏi cần bao phủ — hỏi đủ các mặt của bài vừa học — chứ không cần chọn theo trình độ. Thích ứng ở đây còn có hại: em yếu chỉ gặp câu dễ, tức không bao giờ được hỏi phần quan trọng nhất của bài, và thầy cô không biết em hỏng chỗ nào.
Vì vậy chỗ đúng của khảo thí thích ứng là: xếp lớp đầu vào, đo tăng trưởng qua nhiều kỳ, thi chuẩn hoá dải rộng. Không phải kiểm tra thường xuyên trên lớp.
So sánh trực quan: ba cách tổ chức một bài đo
| Đề cố định cho cả lớp | Đề rút ngẫu nhiên theo ma trận | Đề thích ứng | |
|---|---|---|---|
| Mỗi em làm | Cùng một đề | Đề khác nhau, cùng cấu trúc | Đề khác nhau, khác cả độ khó |
| Số câu cần | Nhiều, để phủ hết dải | Như đề cố định | Khoảng một nửa |
| Cần biết gì về từng câu | Mức độ do người soạn gán | Mức độ và chương | Độ khó đo từ dữ liệu thật |
| Kết quả trả về | Số câu đúng | Số câu đúng | Mức năng lực kèm sai số |
| Học sinh quay lại sửa | Được | Được | Không |
| Dùng đúng chỗ nào | Kiểm tra nội dung vừa dạy | Kiểm tra định kỳ, chống nhìn bài | Xếp lớp, đo tăng trưởng |
| Điều kiện để chạy | Không | Kho đủ câu theo từng ô ma trận | Kho đã hiệu chuẩn |
Cột giữa là cột đáng để ý nhất với phần lớn nhà trường: nó lấy được phần lớn lợi ích thực dụng (mỗi em một đề, chống nhìn bài, dựng đề nhanh) mà không cần hiệu chuẩn. Nhiều nơi đang tìm "đề thích ứng" thực ra cần đúng cột này.
Ba bước để đi về hướng đó, bắt đầu từ chỗ đang đứng
Không ai dựng được đề thích ứng trong một kỳ. Nhưng ba bước dưới đây có giá trị riêng ngay cả khi không bao giờ tới đích, và đó là lý do nên làm theo thứ tự này.
Bước 1 — Bắt đầu đọc ba con số của từng câu hỏi
Đây là bước biến một kho câu thành một kho có dữ liệu, và nó chỉ cần bài kiểm tra bình thường trên máy. Sau mỗi kỳ, với mỗi câu, đọc ba chỉ số:
| Chỉ số | Nghĩa | Đọc thế nào |
|---|---|---|
| Độ khó p | Tỷ lệ học sinh làm đúng | 0,3–0,8 là dải dùng được. Dưới 0,2 thì hoặc quá khó, hoặc câu có lỗi |
| Độ phân biệt D | Nhóm trên làm đúng nhiều hơn nhóm dưới bao nhiêu | Trên 0,3 là tốt. Âm là dấu hiệu nghiêm trọng: nhóm giỏi sai nhiều hơn nhóm yếu, thường do đáp án sai |
| Tương quan điểm-nhị phân r | Câu này có cùng chiều với tổng điểm không | Gần 0 nghĩa là câu không đo cùng thứ với phần còn lại của đề |
Con số đáng hành động ngay là D âm. Nó gần như luôn nghĩa là câu hỏi có vấn đề chứ không phải học sinh có vấn đề — đáp án sai, đề bài mơ hồ, hoặc hai phương án đều đúng. Một câu D âm nằm trong kho sẽ trừ điểm đúng những em giỏi nhất, mỗi lần nó được dùng.
Bước 2 — Dùng ma trận để mỗi em một đề, trước khi nghĩ tới thích ứng
Lợi ích "mỗi em một đề" không cần IRT. Khai ma trận (chương × mức độ → số câu), rồi rút ngẫu nhiên từ kho theo từng ô. Bốn mươi em ra bốn mươi đề khác nhau nhưng cùng cấu trúc, nên so điểm với nhau vẫn hợp lệ.
Bước này cũng là bước lộ ra chỗ kho còn mỏng: ô nào không rút đủ câu thì đó chính là ô cần soạn thêm. Thông tin ấy quý hơn một con số tổng "kho có bao nhiêu câu".
Bước 3 — Chỉ hiệu chuẩn ở chỗ thật sự cần một trục rộng
Khi nào đã có dữ liệu từng câu qua vài kỳ, hãy chọn một mục đích cần dải rộng — thường là xếp lớp đầu vào — và hiệu chuẩn riêng bộ câu cho mục đích ấy. Không hiệu chuẩn cả kho: phần lớn câu trong kho phục vụ kiểm tra nội dung hẹp, nơi thích ứng không giúp gì.
Rào cản thật, và chỗ tôi phải nói rõ hệ thống chưa làm được
Cần nói thẳng để không ai chuẩn bị sai: Grade hiện KHÔNG chạy đề thích ứng. Bảng dữ liệu có một cột dành cho chế độ ấy, nhưng chưa dòng mã nào đọc nó — tức đó là chỗ để dành, không phải một tính năng. Ai đang cần đề tự đổi độ khó theo từng câu thì hệ thống này chưa làm.
Phần hệ thống làm được là hai bước đầu ở trên, và đó là hai bước phải xong trước:
- Phân tích câu hỏi trả về đúng ba chỉ số ở bước 1 — độ khó p, độ phân biệt D theo nhóm 27% trên và dưới, tương quan điểm-nhị phân r — cộng phân tích từng phương án nhiễu và hệ số tin cậy Cronbach's alpha cho cả đề. Đây chính là bộ dụng cụ để hiệu chuẩn một kho, và nó chạy trên mọi đề đã có người làm.
- Sinh đề từ ma trận: khai số câu theo từng ô chương × mức độ, hệ thống rút ngẫu nhiên không trùng và báo rõ ô nào thiếu câu thay vì lặng lẽ trả về một đề mỏng hơn yêu cầu.
Kho dùng chung hiện có gần 1.500 đề công khai và hơn 28.000 câu hỏi trên 23 môn — đủ để bước 2 chạy được ngay ở phần lớn môn và khối.
Thầy cô có thể bắt đầu bằng bảng ba chỉ số ở bước 1: mở phân tích của một đề vừa kiểm tra, tìm câu nào có D âm, và xem lại đáp án của đúng những câu ấy. Tạo đề miễn phí trên Grade để có phân tích câu hỏi cho bài kiểm tra tới.
Đọc thêm: phân tích phổ điểm theo thang Bloom để đọc kết quả sâu hơn, và xây dựng bài kiểm tra xếp lớp — chỗ duy nhất trong nhà trường mà thích ứng thật sự đáng đầu tư.
Nguồn tham khảo
- Frederic M. Lord — Applications of Item Response Theory to Practical Testing Problems, nền tảng lý thuyết ứng đáp câu hỏi
- Howard Wainer (chủ biên) — Computerized Adaptive Testing: A Primer
- NWEA MAP Growth — tài liệu kỹ thuật về đo tăng trưởng bằng đề thích ứng
- Duolingo English Test — báo cáo kỹ thuật về thiết kế đề thích ứng và hiệu chuẩn kho câu
- Chương trình giáo dục phổ thông 2018 — Thông tư 32/2018/TT-BGDĐT, Bộ GD&ĐT
Ảnh minh hoạ: Pexels.
Bắt đầu học cùng Grade
Luyện tập, kiểm tra trình độ và theo dõi tiến độ học tập đa môn — trên web và điện thoại.


