Grade

Phân tích phổ điểm theo thang Bloom: bốn hình dạng phổ điểm và điều mỗi hình dạng nói về lớp

Chấm xong một đề bốn mươi câu, con số đầu tiên ai cũng tính là điểm trung bình của lớp. Nó là con số ít hữu ích nhất trong tất cả những con số có thể tính từ tập dữ liệu ấy.

Q

Quản trị viên

21 tháng 9, 2026· 12 phút đọc

Phân tích phổ điểm theo thang Bloom: bốn hình dạng phổ điểm và điều mỗi hình dạng nói về lớp

Chấm xong một đề bốn mươi câu, con số đầu tiên ai cũng tính là điểm trung bình của lớp. Nó là con số ít hữu ích nhất trong tất cả những con số có thể tính từ tập dữ liệu ấy. Trung bình 6,2 có thể là một lớp đồng đều quanh 6, hoặc một lớp chia làm hai nửa 8 và 4 — hai tình huống cần hai cách dạy tiếp hoàn toàn khác nhau, và trung bình xoá sạch khác biệt đó.

Bàn làm việc với biểu đồ số liệu và máy tính, minh hoạ bài viết về phân tích phổ điểm

Nỗi khó: dữ liệu đã có sẵn, chỉ là không ai đọc nó

Sau mỗi kỳ kiểm tra, thầy cô đang giữ một tập dữ liệu khá giàu: bốn mươi học sinh × bốn mươi câu là một nghìn sáu trăm quan sát. Nhưng thứ được dùng thường chỉ là tổng theo hàng (điểm từng em) và một trung bình. Tổng theo cột — câu nào cả lớp sai — thì ít khi được tính, và các phép tính chéo thì gần như không.

Lý do không phải thầy cô không muốn. Lý do là bốn mươi cột nhân bốn lớp là một buổi ngồi với bảng tính, mỗi kỳ, và không ai chắc là buổi đó đổi được gì.

Bài này nói về bốn con số nên đọc thay cho điểm trung bình, và quan trọng hơn: bốn hình dạng phổ điểm mà mỗi hình dạng dẫn tới một hành động khác nhau. Nếu chỉ đọc được một thứ thì hãy đọc hình dạng, vì nó không cần tính toán gì.

Bản chất: thang Bloom biến một cột điểm thành một bản chẩn đoán

Thang phân loại Bloom — bản sửa năm 2001 của Anderson và Krathwohl — xếp các hoạt động tư duy theo sáu bậc: Nhớ, Hiểu, Vận dụng, Phân tích, Đánh giá, Sáng tạo. Chương trình GDPT 2018 dùng bốn mức gọn hơn, và chúng ứng khá sát:

Mức trong chương trình Việt NamBậc Bloom tương ứngHọc sinh làm gì
Nhận biếtNhớGọi lại một định nghĩa, đọc ra một giá trị
Thông hiểuHiểuGiải thích, so sánh, diễn đạt lại bằng lời mình
Vận dụngVận dụngÁp dụng vào tình huống quen thuộc
Vận dụng caoPhân tích, Đánh giá, Sáng tạoTình huống mới, chọn phương pháp, phản biện một cách giải

Điều thang này đem lại không phải một cách gắn nhãn. Nó cho phép cắt phổ điểm theo mức thay vì gộp: thay vì "lớp đạt 6,2", ta có bốn con số — tỷ lệ đúng ở Nhận biết, ở Thông hiểu, ở Vận dụng, ở Vận dụng cao. Và bốn con số ấy có hình dạng, còn hình dạng thì đọc được.

Bốn hình dạng, và hành động ứng với mỗi hình dạng

Đây là phần dùng được ngay, không cần công cụ gì ngoài một máy tính bỏ túi.

Hình dạng tỷ lệ đúng theo mứcĐọc ra điều gìLàm gì tiếp
Giảm đều: 90 – 75 – 55 – 30Bình thường và lành mạnh. Đề phân tầng đúng, lớp tiến bộ theo bậcKhông phải chữa gì. Đây là hình dạng để so ở kỳ sau
Vách đứng ở Thông hiểu: 92 – 45 – 40 – 30Học sinh nhớ mà không hiểu. Thuộc được định nghĩa, không diễn đạt lại đượcDạy lại bằng ví dụ và phản ví dụ, không dạy lại bằng cách đọc lại định nghĩa
Vách đứng ở Vận dụng: 88 – 80 – 35 – 25Hiểu nhưng không chuyển được. Biết công thức, không nhận ra lúc nào dùngLuyện nhận dạng tình huống: cho bài không nói phải dùng gì
Lên xuống thất thường: 70 – 85 – 50 – 65Gần như luôn là lỗi gán mức của đề, không phải hiện tượng của lớpĐọc lại từng câu: có câu bị gán mức sai

Hình dạng thứ tư là hình dạng quan trọng nhất để nhận ra, vì nó nói rằng dữ liệu chưa dùng được. Một lớp không thể làm câu Thông hiểu tốt hơn câu Nhận biết trên cùng một nội dung. Khi thấy nó, đừng kết luận gì về học sinh — đi kiểm mức độ đã gán cho từng câu.

Vì sao chuyện gán mức lại là mắt yếu nhất của cả phép phân tích

Cần nói thẳng điều này vì nó quyết định mức độ tin cậy của mọi báo cáo theo Bloom: mức độ của một câu hỏi là phán đoán của người soạn, không phải một thuộc tính đo được.

Người này coi "tính đạo hàm của hàm hợp" là Thông hiểu, người kia coi là Vận dụng. Cả hai đều có lý. Và trong các kho câu hỏi lớn — kể cả kho của chúng tôi — nhiều câu được gán mức bằng phỏng đoán từ những dấu hiệu gián tiếp chứ không phải do người soạn đề cân nhắc từng câu. Một báo cáo theo Bloom chỉ tốt đúng bằng chất lượng của phần gán nhãn ấy.

May là có một phép kiểm chéo rất mạnh và gần như miễn phí: so mức đã gán với độ khó ĐO ĐƯỢC.

  • Câu gán Nhận biết mà chỉ 35% lớp làm đúng → hoặc câu bị gán sai mức, hoặc câu có lỗi.
  • Câu gán Vận dụng cao mà 90% làm đúng → câu ấy thực ra là Nhận biết, hoặc đáp án lộ.

Phép so này không cần thêm dữ liệu gì — hai cột đã nằm sẵn cạnh nhau. Và nó thường sửa được nhãn của một vài câu mỗi kỳ, khiến báo cáo kỳ sau đáng tin hơn.

Bốn con số nên đọc thay cho điểm trung bình

Chỉ sốCách tínhDải dùng đượcĐọc thế nào khi nằm ngoài dải
Độ khó pTỷ lệ học sinh làm đúng câu đó0,3 – 0,8Trên 0,9: câu không phân biệt được ai. Dưới 0,2: quá khó hoặc câu có lỗi
Độ phân biệt DTỷ lệ đúng của nhóm 27% điểm cao trừ tỷ lệ đúng của nhóm 27% điểm thấpTrên 0,3Dưới 0,2: câu không tách được trình độ. Âm: xem lại đáp án ngay
Tương quan điểm-nhị phân rTương quan giữa làm đúng câu này và tổng điểmTrên 0,2Gần 0: câu này đo thứ khác với phần còn lại của đề
Hệ số tin cậy alphaĐộ nhất quán nội tại của cả đềTrên 0,7 với đề tổng kếtThấp: đề đang đo nhiều thứ rời rạc, hoặc quá ngắn

Trong bốn con số, D âm là con số duy nhất đòi hành động ngay lập tức. Nó nghĩa là nhóm học sinh giỏi nhất làm sai câu đó nhiều hơn nhóm yếu nhất — điều gần như không xảy ra với một câu hỏi lành. Ba nguyên nhân thường gặp, theo thứ tự phổ biến: đáp án ghi sai, hai phương án đều đúng, và đề bài mơ hồ theo cách chỉ học sinh giỏi mới nhận ra. Câu D âm nằm trong kho sẽ trừ điểm đúng những em giỏi nhất, mỗi lần nó được dùng lại.

⚠️ Một lưu ý về alpha mà hay bị dùng sai: alpha tăng theo số câu. Một đề mười câu và một đề bốn mươi câu không so alpha với nhau được, và "nâng alpha" bằng cách thêm câu không làm đề tốt hơn. Alpha chỉ để so cùng một đề qua các kỳ, hoặc để phát hiện một đề đang trộn nhiều thứ không liên quan.

Phân tích phương án nhiễu: chỗ rẻ nhất để cải thiện một đề

Với câu trắc nghiệm, còn một lớp dữ liệu nữa gần như luôn bị bỏ: bao nhiêu học sinh chọn mỗi phương án sai.

Điều thấy đượcNghĩa là gìLàm gì
Một phương án không ai chọnNó quá vô lý, câu thực chất chỉ còn ba phương án — xác suất đoán bừa lên 33%Thay bằng một cách hiểu sai có thật
Một phương án sai hút nhiều hơn đáp ánĐó là một cách hiểu sai rất phổ biến trong lớpĐây là thông tin dạy học quý nhất của cả đề. Dạy lại đúng chỗ đó
Nhóm giỏi và nhóm yếu chọn cùng một phương án saiCâu hỏi có vấn đề, không phải học sinhĐọc lại đề bài và đáp án

Dòng giữa là lý do đáng đọc bảng này nhất. Một phương án nhiễu hút được nhiều học sinh không phải một thất bại của đề — nó là một chẩn đoán đã hoàn thành: cả lớp đang hiểu sai theo đúng kiểu đó, và thầy cô biết chính xác phải chữa gì.

Ba bước đọc kết quả của bài kiểm tra tới

Bước 1 — Vẽ hình dạng trước khi tính gì cả (5 phút)

Chia câu theo bốn mức, tính tỷ lệ đúng của mỗi nhóm, viết ra bốn số. So với bảng bốn hình dạng ở trên.

Nếu ra hình dạng thứ tư — thất thường — dừng lại ở đây và đi kiểm nhãn mức độ. Mọi phân tích sâu hơn trên một bộ nhãn sai đều cho ra kết luận sai mà trông rất thuyết phục.

Bước 2 — Lọc ra các câu cần xem lại, theo đúng thứ tự này

Không đọc cả bốn mươi câu. Chỉ lấy những câu rơi vào ba rổ, theo thứ tự ưu tiên:

  1. D âm — xem đáp án ngay, trước cả khi trả bài nếu còn kịp.
  2. p dưới 0,2 kèm mức được gán là Nhận biết hoặc Thông hiểu — mâu thuẫn giữa nhãn và số đo.
  3. Có một phương án nhiễu hút nhiều hơn đáp án — không phải lỗi, mà là nội dung cần dạy lại.

Ba rổ này thường gom lại chỉ ba tới bảy câu trên một đề bốn mươi câu. Đó là lượng đọc được trong mười lăm phút.

Bước 3 — Viết hai dòng vào biên bản tổ, và giữ lại con số để so kỳ sau

Hai dòng, không cần dài:

  • Nội dung cần dạy lại, kèm bằng chứng: "Quy tắc đổi chiều bất phương trình — 62% lớp chọn phương án quên đổi chiều ở câu 17."
  • Câu cần sửa trong kho, kèm lý do: "Câu 23 có D = −0,15, hai phương án B và C đều đúng."

Và ghi lại bốn con số hình dạng. Chúng chỉ có nghĩa khi có cái để so — bốn số của kỳ này đặt cạnh bốn số của kỳ trước mới cho biết việc dạy lại có tác dụng hay không.

Rào cản thật: một nghìn sáu trăm ô, mỗi kỳ, bốn lớp

Mọi phép tính trên đây làm được bằng bảng tính. Nhưng phải nói thật về chi phí: dựng ma trận bốn mươi câu × bốn mươi em, tính p cho từng cột, chia nhóm 27% trên và dưới để tính D, đếm phân bố từng phương án — đó là một buổi cho một đề của một lớp. Nhân bốn lớp và hai kỳ thì nó không xảy ra, và vì thế dữ liệu vẫn nằm đó không được đọc.

Đây đúng là loại việc nên để máy làm, vì nó hoàn toàn cơ học. Grade có sẵn phân tích câu hỏi cho mọi đề đã có người làm, trả về đúng bộ chỉ số ở bảng trên: độ khó p, độ phân biệt D theo nhóm 27% trên và dưới, tương quan điểm-nhị phân r, phân tích từng phương án nhiễu, và hệ số tin cậy alpha cho cả đề.

Hai chi tiết về cách nó được dựng, đáng nói vì chúng ảnh hưởng tới việc tin con số:

  • Câu bỏ trống được tính tỷ lệ đúng bằng 0, không bị loại khỏi mẫu. Loại chúng ra sẽ làm mọi câu khó trông dễ hơn thực tế.
  • Phép tính được kiểm bằng một bộ tính lại từ định nghĩa, không phải bằng cách so với ảnh chụp kết quả cũ — vì p, D, r và alpha đều là số thực trông hợp lý ở mọi giá trị, nên một sai lệch sẽ không lộ ra ở đâu nếu chỉ so với chính mình.

Kho dùng chung hiện có gần 1.500 đề công khai và hơn 28.000 câu hỏi trên 23 môn. Và đúng theo cảnh báo ở giữa bài: mức độ của nhiều câu trong kho là phỏng đoán, nên phép so "mức đã gán với độ khó đo được" là việc nên làm với bất kỳ đề nào lấy từ kho chung.

Thầy cô có thể bắt đầu bằng bước 1 — năm phút, bốn con số: chia câu theo bốn mức, tính tỷ lệ đúng từng nhóm, và xem lớp mình ra hình dạng nào trong bốn hình dạng. Tạo đề miễn phí trên Grade để có sẵn bộ chỉ số cho bài kiểm tra tới.

Đọc thêm: khảo thí thích ứng — bộ chỉ số ở bài này chính là bước đầu để hiệu chuẩn một kho câu, và đánh giá quá trình cho cách phát hiện chỗ hổng trước khi hết chương.

Nguồn tham khảo

  • Lorin W. Anderson & David R. Krathwohl (chủ biên) — A Taxonomy for Learning, Teaching, and Assessing, bản sửa của thang Bloom (2001)
  • Tài liệu kỹ thuật về phân tích câu hỏi: độ khó, độ phân biệt nhóm cực biên 27% và tương quan điểm-nhị phân — Educational Testing Service (Hoa Kỳ)
  • Lee J. Cronbach — Coefficient alpha and the internal structure of tests (1951)
  • Chương trình giáo dục phổ thông 2018 — Thông tư 32/2018/TT-BGDĐT, Bộ GD&ĐT
  • Quy định đánh giá học sinh THCS và THPT — Thông tư 22/2021/TT-BGDĐT, Bộ GD&ĐT

Ảnh minh hoạ: Pexels.

Bắt đầu học cùng Grade

Luyện tập, kiểm tra trình độ và theo dõi tiến độ học tập đa môn — trên web và điện thoại.

Đăng ký miễn phí

Bài viết liên quan

Ngân hàng câu hỏi tập trung: con số đáng lo không phải câu trùng, mà là câu trùng khác đáp án
Khảo thí & đánh giá

Ngân hàng câu hỏi tập trung: con số đáng lo không phải câu trùng, mà là câu trùng khác đáp án

Một tổ chuyên môn năm người, mỗi người có một thư mục đề trong máy mình. Sau bốn năm, tổ có khoảng hai nghìn câu hỏi nằm rải trong bảy chục tệp. Không ai biết tổng số thật là bao nhiêu, câu nào đã dùng cho lớp nào, và câu nào đang tồn tại ở hai bản với hai đáp án khác nhau.

25/09/2026 13 phút đọc
Chấm điểm đa nền tảng: học sinh làm bài trên giấy, chụp lại, và máy chép chữ trước khi chấm
Khảo thí & đánh giá

Chấm điểm đa nền tảng: học sinh làm bài trên giấy, chụp lại, và máy chép chữ trước khi chấm

Cuộc tranh luận "thi trên giấy hay thi trên máy" thường được đặt sai ở cấp độ: nó được hỏi cho cả bài kiểm tra, trong khi câu trả lời đúng lại khác nhau cho từng loại câu hỏi trong cùng bài đó. Một câu trắc nghiệm thì làm trên máy hơn hẳn — chấm ngay, không nhập điểm tay.

24/09/2026 13 phút đọc