Grade

Khảo thí thích ứng: vì sao đề tự đổi độ khó cần một kho đã hiệu chuẩn, và điều đó nghĩa là gì với lớp học

Một bài thi bốn mươi câu đưa cho cả lớp. Em giỏi nhất làm mười câu đầu đã đúng hết và hai mươi câu dễ còn lại không nói thêm gì về em ấy. Em yếu nhất gặp mười lăm câu vận dụng cao ở cuối và cũng không nói thêm gì — em sai hết, nhưng ta không biết em đang ở mức nào.

Q

Quản trị viên

19 tháng 9, 2026· 11 phút đọc

Khảo thí thích ứng: vì sao đề tự đổi độ khó cần một kho đã hiệu chuẩn, và điều đó nghĩa là gì với lớp học

Một bài thi bốn mươi câu đưa cho cả lớp. Em giỏi nhất làm mười câu đầu đã đúng hết và hai mươi câu dễ còn lại không nói thêm gì về em ấy. Em yếu nhất gặp mười lăm câu vận dụng cao ở cuối và cũng không nói thêm gì — em sai hết, nhưng ta không biết em đang ở mức nào. Với cả hai em, phần lớn thời gian làm bài không tạo ra thông tin.

Học sinh làm bài trên máy tính bảng bằng bút cảm ứng, minh hoạ bài viết về khảo thí thích ứng

Nỗi khó: một đề cố định không thể vừa với cả lớp

Mọi thầy cô ra đề đều gặp một bài toán không có lời giải tốt: đề dễ thì không phân biệt được nhóm trên, đề khó thì nhóm dưới mất hết động lực và điểm dồn về một đầu. Tỷ lệ 4:3:3 giữa các mức độ là một cách dung hoà, và nó là cách dung hoà đúng cho một đề giấy — nhưng nó vẫn là dung hoà.

Câu hỏi mà hướng khảo thí thích ứng đặt ra khác đi: nếu đề không cần giống nhau cho mọi học sinh thì sao? Nếu sau mỗi câu, hệ thống ước lượng lại trình độ của em rồi chọn câu tiếp theo vừa với ước lượng đó?

Đây không phải ý tưởng mới hay chuyện tương lai. GMAT, GRE, bộ đo tăng trưởng MAP của NWEA và Duolingo English Test đều chạy theo cách này từ lâu. Nhưng nó có ba điều kiện, và hiểu ba điều kiện ấy quan trọng hơn hiểu thuật toán — vì chúng quyết định việc này dùng được ở đâu và không dùng được ở đâu.

Bản chất: đo bằng cách chọn câu gần với trình độ hiện tại

Nền lý thuyết là lý thuyết ứng đáp câu hỏi (Item Response Theory, IRT). Nó đổi cách nghĩ về điểm số theo một hướng đáng để nắm, dù không định làm đề thích ứng.

Trong cách tính điểm quen thuộc, điểm của học sinh là số câu đúng — tức mọi câu đáng giá như nhau. IRT nói: mỗi câu hỏi có một độ khó riêng, mỗi học sinh có một mức năng lực riêng, và xác suất em trả lời đúng một câu phụ thuộc vào khoảng cách giữa hai con số ấy. Trả lời đúng một câu khó nói nhiều hơn trả lời đúng một câu dễ, và phép tính điểm phản ánh điều đó.

Từ đó ra một hệ quả then chốt: một câu hỏi cho nhiều thông tin nhất khi độ khó của nó gần với năng lực của người làm. Câu quá dễ thì gần như chắc chắn đúng — biết trước kết quả thì không học thêm được gì. Câu quá khó thì gần như chắc chắn sai — cũng vậy. Câu mà em có khoảng một nửa cơ hội làm đúng là câu nói nhiều nhất.

Đề thích ứng làm đúng một việc: sau mỗi câu, ước lượng lại năng lực rồi chọn câu tiếp theo có độ khó gần ước lượng đó nhất. Vòng lặp dừng khi sai số của ước lượng xuống dưới một ngưỡng khai trước, hoặc khi hết số câu tối đa.

BướcViệc hệ thống làm
1Bắt đầu bằng một câu độ khó trung bình
2Ghi đúng/sai, ước lượng lại năng lực và sai số của ước lượng
3Chọn câu kế tiếp có độ khó gần ước lượng mới nhất
4Lặp lại cho tới khi sai số dưới ngưỡng, hoặc hết số câu tối đa
5Báo về năng lực kèm sai số — không phải "đúng bao nhiêu câu trên bao nhiêu"

Hiệu quả đo được của cách này khá nhất quán qua các hệ thống thật: cùng độ chính xác với khoảng một nửa số câu. Một bài bốn mươi câu cố định thay được bằng khoảng hai mươi câu thích ứng. Đó là một tiếng rưỡi tiết kiệm cho mỗi lớp mỗi kỳ.

Ba điều kiện, và điều kiện đầu là chỗ mọi kế hoạch vỡ

Một — kho câu phải được HIỆU CHUẨN. Thuật toán ở trên cần biết độ khó bằng số của từng câu. Không phải "đây là câu vận dụng cao" theo đánh giá của người soạn, mà một con số đo từ bài làm thật. Muốn có nó thì mỗi câu phải được hàng trăm học sinh làm qua, rồi từ dữ liệu ấy tính ra tham số.

Đây là điều kiện đắt nhất và hay bị bỏ qua nhất khi nói về đề thích ứng. Một kho mười nghìn câu chưa hiệu chuẩn thì không chạy thích ứng được, trong khi một kho ba trăm câu đã hiệu chuẩn thì chạy được. Số câu không phải thứ quyết định; dữ liệu về từng câu mới là.

Hai — mọi câu phải đo cùng MỘT chiều. IRT giả định có một trục năng lực duy nhất để xếp cả câu hỏi lẫn học sinh lên. Một kho trộn "năng lực đọc hiểu" với "năng lực tính toán" thì một con số duy nhất không mô tả được, và ước lượng trở nên vô nghĩa dù thuật toán vẫn chạy và vẫn trả về số.

Ba — học sinh không được quay lại sửa câu trước. Câu sau được chọn dựa trên câu trước, nên sửa câu trước là làm vô hiệu cả chuỗi lựa chọn sau đó. Điều này đổi hẳn trải nghiệm làm bài, và với học sinh nhỏ thì nó là một mất mát thật — chiến thuật "làm câu dễ trước, quay lại câu khó sau" không dùng được nữa.

Vì sao nó KHÔNG phù hợp bài kiểm tra 15 phút

Đây là phần cần nói rõ, vì hướng thích ứng hay được giới thiệu như thứ tốt hơn cho mọi hoàn cảnh.

Đề thích ứng đo một trục năng lực rộng: em đang ở đâu trên thang toán học nói chung. Còn bài kiểm tra 15 phút của thầy cô đo một nội dung hẹp vừa dạy: em có nắm hằng đẳng thức học tuần này không. Hai mục đích khác nhau tới mức hình thức của cái này sai với cái kia.

Với nội dung hẹp, câu hỏi cần bao phủ — hỏi đủ các mặt của bài vừa học — chứ không cần chọn theo trình độ. Thích ứng ở đây còn có hại: em yếu chỉ gặp câu dễ, tức không bao giờ được hỏi phần quan trọng nhất của bài, và thầy cô không biết em hỏng chỗ nào.

Vì vậy chỗ đúng của khảo thí thích ứng là: xếp lớp đầu vào, đo tăng trưởng qua nhiều kỳ, thi chuẩn hoá dải rộng. Không phải kiểm tra thường xuyên trên lớp.

So sánh trực quan: ba cách tổ chức một bài đo

Đề cố định cho cả lớpĐề rút ngẫu nhiên theo ma trậnĐề thích ứng
Mỗi em làmCùng một đềĐề khác nhau, cùng cấu trúcĐề khác nhau, khác cả độ khó
Số câu cầnNhiều, để phủ hết dảiNhư đề cố địnhKhoảng một nửa
Cần biết gì về từng câuMức độ do người soạn gánMức độ và chươngĐộ khó đo từ dữ liệu thật
Kết quả trả vềSố câu đúngSố câu đúngMức năng lực kèm sai số
Học sinh quay lại sửaĐượcĐượcKhông
Dùng đúng chỗ nàoKiểm tra nội dung vừa dạyKiểm tra định kỳ, chống nhìn bàiXếp lớp, đo tăng trưởng
Điều kiện để chạyKhôngKho đủ câu theo từng ô ma trậnKho đã hiệu chuẩn

Cột giữa là cột đáng để ý nhất với phần lớn nhà trường: nó lấy được phần lớn lợi ích thực dụng (mỗi em một đề, chống nhìn bài, dựng đề nhanh) mà không cần hiệu chuẩn. Nhiều nơi đang tìm "đề thích ứng" thực ra cần đúng cột này.

Ba bước để đi về hướng đó, bắt đầu từ chỗ đang đứng

Không ai dựng được đề thích ứng trong một kỳ. Nhưng ba bước dưới đây có giá trị riêng ngay cả khi không bao giờ tới đích, và đó là lý do nên làm theo thứ tự này.

Bước 1 — Bắt đầu đọc ba con số của từng câu hỏi

Đây là bước biến một kho câu thành một kho có dữ liệu, và nó chỉ cần bài kiểm tra bình thường trên máy. Sau mỗi kỳ, với mỗi câu, đọc ba chỉ số:

Chỉ sốNghĩaĐọc thế nào
Độ khó pTỷ lệ học sinh làm đúng0,3–0,8 là dải dùng được. Dưới 0,2 thì hoặc quá khó, hoặc câu có lỗi
Độ phân biệt DNhóm trên làm đúng nhiều hơn nhóm dưới bao nhiêuTrên 0,3 là tốt. Âm là dấu hiệu nghiêm trọng: nhóm giỏi sai nhiều hơn nhóm yếu, thường do đáp án sai
Tương quan điểm-nhị phân rCâu này có cùng chiều với tổng điểm khôngGần 0 nghĩa là câu không đo cùng thứ với phần còn lại của đề

Con số đáng hành động ngay là D âm. Nó gần như luôn nghĩa là câu hỏi có vấn đề chứ không phải học sinh có vấn đề — đáp án sai, đề bài mơ hồ, hoặc hai phương án đều đúng. Một câu D âm nằm trong kho sẽ trừ điểm đúng những em giỏi nhất, mỗi lần nó được dùng.

Bước 2 — Dùng ma trận để mỗi em một đề, trước khi nghĩ tới thích ứng

Lợi ích "mỗi em một đề" không cần IRT. Khai ma trận (chương × mức độ → số câu), rồi rút ngẫu nhiên từ kho theo từng ô. Bốn mươi em ra bốn mươi đề khác nhau nhưng cùng cấu trúc, nên so điểm với nhau vẫn hợp lệ.

Bước này cũng là bước lộ ra chỗ kho còn mỏng: ô nào không rút đủ câu thì đó chính là ô cần soạn thêm. Thông tin ấy quý hơn một con số tổng "kho có bao nhiêu câu".

Bước 3 — Chỉ hiệu chuẩn ở chỗ thật sự cần một trục rộng

Khi nào đã có dữ liệu từng câu qua vài kỳ, hãy chọn một mục đích cần dải rộng — thường là xếp lớp đầu vào — và hiệu chuẩn riêng bộ câu cho mục đích ấy. Không hiệu chuẩn cả kho: phần lớn câu trong kho phục vụ kiểm tra nội dung hẹp, nơi thích ứng không giúp gì.

Rào cản thật, và chỗ tôi phải nói rõ hệ thống chưa làm được

Cần nói thẳng để không ai chuẩn bị sai: Grade hiện KHÔNG chạy đề thích ứng. Bảng dữ liệu có một cột dành cho chế độ ấy, nhưng chưa dòng mã nào đọc nó — tức đó là chỗ để dành, không phải một tính năng. Ai đang cần đề tự đổi độ khó theo từng câu thì hệ thống này chưa làm.

Phần hệ thống làm được là hai bước đầu ở trên, và đó là hai bước phải xong trước:

  • Phân tích câu hỏi trả về đúng ba chỉ số ở bước 1 — độ khó p, độ phân biệt D theo nhóm 27% trên và dưới, tương quan điểm-nhị phân r — cộng phân tích từng phương án nhiễu và hệ số tin cậy Cronbach's alpha cho cả đề. Đây chính là bộ dụng cụ để hiệu chuẩn một kho, và nó chạy trên mọi đề đã có người làm.
  • Sinh đề từ ma trận: khai số câu theo từng ô chương × mức độ, hệ thống rút ngẫu nhiên không trùng và báo rõ ô nào thiếu câu thay vì lặng lẽ trả về một đề mỏng hơn yêu cầu.

Kho dùng chung hiện có gần 1.500 đề công khai và hơn 28.000 câu hỏi trên 23 môn — đủ để bước 2 chạy được ngay ở phần lớn môn và khối.

Thầy cô có thể bắt đầu bằng bảng ba chỉ số ở bước 1: mở phân tích của một đề vừa kiểm tra, tìm câu nào có D âm, và xem lại đáp án của đúng những câu ấy. Tạo đề miễn phí trên Grade để có phân tích câu hỏi cho bài kiểm tra tới.

Đọc thêm: phân tích phổ điểm theo thang Bloom để đọc kết quả sâu hơn, và xây dựng bài kiểm tra xếp lớp — chỗ duy nhất trong nhà trường mà thích ứng thật sự đáng đầu tư.

Nguồn tham khảo

  • Frederic M. Lord — Applications of Item Response Theory to Practical Testing Problems, nền tảng lý thuyết ứng đáp câu hỏi
  • Howard Wainer (chủ biên) — Computerized Adaptive Testing: A Primer
  • NWEA MAP Growth — tài liệu kỹ thuật về đo tăng trưởng bằng đề thích ứng
  • Duolingo English Test — báo cáo kỹ thuật về thiết kế đề thích ứng và hiệu chuẩn kho câu
  • Chương trình giáo dục phổ thông 2018 — Thông tư 32/2018/TT-BGDĐT, Bộ GD&ĐT

Ảnh minh hoạ: Pexels.

Bắt đầu học cùng Grade

Luyện tập, kiểm tra trình độ và theo dõi tiến độ học tập đa môn — trên web và điện thoại.

Đăng ký miễn phí

Bài viết liên quan

Ngân hàng câu hỏi tập trung: con số đáng lo không phải câu trùng, mà là câu trùng khác đáp án
Khảo thí & đánh giá

Ngân hàng câu hỏi tập trung: con số đáng lo không phải câu trùng, mà là câu trùng khác đáp án

Một tổ chuyên môn năm người, mỗi người có một thư mục đề trong máy mình. Sau bốn năm, tổ có khoảng hai nghìn câu hỏi nằm rải trong bảy chục tệp. Không ai biết tổng số thật là bao nhiêu, câu nào đã dùng cho lớp nào, và câu nào đang tồn tại ở hai bản với hai đáp án khác nhau.

25/09/2026 13 phút đọc
Chấm điểm đa nền tảng: học sinh làm bài trên giấy, chụp lại, và máy chép chữ trước khi chấm
Khảo thí & đánh giá

Chấm điểm đa nền tảng: học sinh làm bài trên giấy, chụp lại, và máy chép chữ trước khi chấm

Cuộc tranh luận "thi trên giấy hay thi trên máy" thường được đặt sai ở cấp độ: nó được hỏi cho cả bài kiểm tra, trong khi câu trả lời đúng lại khác nhau cho từng loại câu hỏi trong cùng bài đó. Một câu trắc nghiệm thì làm trên máy hơn hẳn — chấm ngay, không nhập điểm tay.

24/09/2026 13 phút đọc