← Trang chủ
AI at Work

Khóa tiêu chí trước, rồi mới để AI gom lỗi của cả lớp

Một cách dùng AI để gom lỗi lặp lại trong exit ticket mà vẫn giữ câu mơ hồ và quyết định sư phạm ở giáo viên.

Có 32 exit ticket sau tiết học và bạn đã biết mình cần nhìn vào điều gì. Vấn đề là đọc 32 câu để tìm cùng một lỗi vẫn tốn thời gian. Đây là lúc AI có thể giúp — nhưng chỉ ở phần sắp xếp đã được định nghĩa trước.

Hãy hình dung tám câu trả lời đã bỏ tên cho một bài toán tỉ lệ. Giáo viên khóa trước ba dấu hiệu cần tìm: nhầm đại lượng, đảo tỉ lệ, và thiếu bước giải thích. Một câu thứ tư có đáp số sai nhưng lời giải quá ngắn để biết nguyên nhân. Với câu này, đầu ra đúng không phải là đoán một nhãn; đầu ra đúng là NEEDS_TEACHER_REVIEW.

Tám câu và kết quả minh họa dưới đây là dữ liệu tổng hợp để giải thích quy trình, không phải kết quả chạy một model hay dữ liệu từ một lớp học thật.

Tự khóa tiêu chí trước khi mở chatbot

Đừng bắt đầu bằng câu lệnh kiểu “hãy tìm các lỗi phổ biến trong bài của học sinh”. Câu lệnh đó giao cho hệ thống hai việc cùng lúc: tự nghĩ ra tiêu chí và tự phân loại. Khi kết quả trông hợp lý, giáo viên rất khó biết hệ thống đang bám vào mục tiêu bài học hay chỉ tạo ra những nhóm nghe có vẻ thuyết phục.

Thay vào đó, viết tiêu chí bằng dấu hiệu có thể chỉ ngược về câu trả lời gốc. Ví dụ:

  • NHAM_DAI_LUONG: câu trả lời dùng số của đại lượng A ở vị trí cần đại lượng B;
  • DAO_TI_LE: phép tính thể hiện tử và mẫu bị đảo so với quan hệ đã dạy;
  • THIEU_GIAI_THICH: có kết quả nhưng không có bước hoặc câu giải thích mà yêu cầu bài bắt buộc;
  • NEEDS_TEACHER_REVIEW: không có đủ bằng chứng để chọn một trong ba nhãn trên.

Các nhãn này không phải chẩn đoán về học sinh. Chúng chỉ mô tả điều nhìn thấy trong một câu trả lời cụ thể. Nếu mục tiêu bài học khác, bộ tiêu chí cũng phải khác.

UNESCO AI Competency Framework for Teachers đặt human agency và human accountability ở trung tâm năng lực AI của giáo viên, đồng thời nhấn mạnh việc đánh giá sự phù hợp và giới hạn của công cụ trong bối cảnh cụ thể. Guidance for Generative AI in Education and Research cũng khuyến nghị cách tiếp cận lấy con người làm trung tâm. Hai nguồn này hỗ trợ ranh giới “giáo viên định nghĩa và chịu trách nhiệm”; chúng không chứng minh bộ nhãn trong ví dụ này là phương pháp sư phạm tối ưu.

Yêu cầu bằng chứng cho từng nhãn

Khi đưa các câu trả lời đã ẩn danh vào công cụ được nhà trường cho phép, yêu cầu đầu ra rất hẹp: mã câu trả lời, nhãn, và một đoạn trích ngắn cho thấy vì sao nhãn đó phù hợp. Không có đoạn trích đủ rõ thì phải trả về NEEDS_TEACHER_REVIEW.

Một prompt có thể diễn đạt như sau:

Chỉ dùng bốn nhãn đã cho. Không suy đoán nguyên nhân ngoài nội dung câu trả lời. Với mỗi nhãn khác NEEDS_TEACHER_REVIEW, hãy chỉ ra cụm từ hoặc phép tính làm bằng chứng. Nếu hai nhãn đều có vẻ có thể đúng nhưng không đủ dữ kiện để phân biệt, dùng NEEDS_TEACHER_REVIEW.

Điểm quan trọng nằm ở bằng chứng gắn với câu gốc. Một bảng “5 em sai tỉ lệ, 3 em thiếu giải thích” nhìn gọn nhưng chưa đủ để kiểm tra. Khi mỗi nhãn có thể quay lại đúng phép tính hoặc câu chữ, giáo viên mới có cách phát hiện AI đang phân loại quá tay.

Hai câu mơ hồ nên làm hệ thống chậm lại

Trong tập tám câu tổng hợp, hãy cố ý giữ ít nhất một hoặc hai trường hợp không đủ rõ. Chẳng hạn, học sinh chỉ viết một đáp số sai mà không có phép tính. Ta biết câu trả lời chưa đạt, nhưng không biết đó là đảo tỉ lệ, chọn nhầm đại lượng hay lỗi số học.

Nếu hệ thống gắn DAO_TI_LE chỉ vì đây là lỗi thường gặp, nó đã vượt ranh giới. Hãy sửa rule hoặc prompt cho tới khi câu này quay về NEEDS_TEACHER_REVIEW.

Một trường hợp khác có thể vừa dùng sai đại lượng vừa thiếu giải thích. Nếu mục đích của bạn là tìm lỗi khái niệm để chuẩn bị dạy lại, hãy quy định rõ nhãn nào được ưu tiên hoặc cho phép nhiều nhãn. Đừng để model tự tạo thứ tự ưu tiên sau khi đã nhìn dữ liệu. Thứ tự đó là một quyết định của giáo viên vì nó thay đổi cách cả lớp được nhìn nhận.

Dùng tám câu cũ như phép kiểm hồi quy

Sau khi chỉnh prompt, đừng chỉ thử trên câu mới. Chạy lại đúng tám câu đã biết. Đây là phép kiểm nhỏ nhưng hữu ích: những trường hợp rõ phải tiếp tục vào đúng nhóm, còn những trường hợp mơ hồ phải tiếp tục về hàng chờ.

Bạn có thể lưu một bảng bốn cột: mã ẩn danh, nhãn giáo viên kỳ vọng, nhãn AI trả về, và bằng chứng AI trích. Khi thay model, thay prompt hoặc thêm tiêu chí, chạy lại bảng này trước. Nếu một câu từng được giữ cho giáo viên nay bị tự động ép vào nhóm, thay đổi đó chưa nên đi vào quy trình thật.

Không cần đặt một tỷ lệ chính xác kiểu “95% thì an toàn”. Tám câu cũng không phải benchmark. Nó chỉ là một bộ regression nhỏ để phát hiện việc rule đã biết bị phá sau thay đổi. Khi phạm vi bài tập đổi đáng kể, giáo viên cần xem lại tiêu chí và thêm các trường hợp đại diện mới.

Tự động hóa phần gom, không tự động hóa quyết định dạy

Khi cổng phân loại đã ổn trên tập kiểm nhỏ, AI có thể giúp gom các câu rõ ràng để giáo viên đọc theo cụm. Hàng chờ mơ hồ vẫn được xem riêng. Từ đó, giáo viên có thể quyết định có cần dạy lại một khái niệm, hỏi thêm một câu, hay đơn giản là một học sinh tính nhầm.

Ba việc không nên được suy ra tự động từ nhãn này: nguyên nhân sâu xa vì sao một học sinh sai; can thiệp cá nhân nào phù hợp; và có nên thay đổi mục tiêu học tập của cả lớp hay không. Một nhãn dựa trên vài dòng chữ không có đủ thông tin cho các quyết định đó.

Với dữ liệu thật, bước đầu tiên còn là kiểm tra quy định của trường và công cụ được phép dùng. Bỏ tên khỏi một bảng không tự động biến mọi dữ liệu thành an toàn; nội dung tự do vẫn có thể chứa thông tin nhận diện. Nếu chưa có cơ sở phù hợp để đưa bài làm vào một dịch vụ AI, hãy dừng ở việc thiết kế tiêu chí và kiểm thử bằng dữ liệu giả lập.

Khi nào cổng này đáng dùng

Cách làm này hợp với câu trả lời ngắn, tiêu chí hẹp và lỗi có dấu hiệu quan sát được. Nó kém phù hợp với bài luận, phản hồi cảm xúc, đánh giá sáng tạo hoặc tình huống cần hiểu bối cảnh cá nhân. Ở đó, việc “gom lỗi” có thể làm mất nhiều thông tin hơn số phút nó tiết kiệm.

Mục tiêu của bước Automate/Lead/Build không phải là để AI đọc thay giáo viên. Mục tiêu là xác định phần việc nào đủ rõ để máy sắp xếp, phần nào phải quay lại cho người dạy, và có một tập kiểm nhỏ để biết ranh giới đó còn hoạt động sau mỗi thay đổi.

Nguồn tham khảo