Tỉ lệ rớt môn luôn là một chỉ số đáng quan tâm trong hệ thống giáo dục đại học, đặc biệt với ngành Công nghệ Thông tin (CNTT) – nơi sinh viên thường đối mặt với nhiều môn học khó như lập trình, cấu trúc dữ liệu, hệ điều hành hay mạng máy tính. Việc rớt môn không chỉ ảnh hưởng đến tiến độ học tập mà còn làm giảm động lực và gia tăng nguy cơ bỏ học giữa chừng.
Vì vậy, việc khai thác dữ liệu điểm học tập để phát hiện xu hướng rớt môn sẽ mang lại giá trị thực tiễn rất cao. Nhà trường, khoa và giảng viên có thể dựa vào các thống kê và trực quan hóa để đưa ra giải pháp can thiệp sớm, từ đó giảm tỷ lệ rớt, nâng cao chất lượng đào tạo và tối ưu hóa chương trình giảng dạy.
Chuẩn bị dữ liệu phân tích
Để phân tích, chúng ta cần một tập dữ liệu chứa thông tin điểm số của sinh viên ngành CNTT. Dataset lý tưởng sẽ bao gồm các cột: mã số sinh viên, tên sinh viên, tên môn học, điểm môn và tên khoa. Tuy nhiên, trong trường hợp bạn chưa có bộ dữ liệu thực tế, có thể tạo dữ liệu giả lập để thực hành.
Bạn có thể tạo nhanh bằng Python như sau:
import pandas as pd
# Tạo dữ liệu giả lập
data = {
"MSSV": ["20201101", "20201102", "20201103", "20201104", "20201105"] * 3,
"Họ tên": ["Nguyễn Văn A", "Lê Thị B", "Trần Văn C", "Phạm Thị D", "Đỗ Văn E"] * 3,
"Môn học": ["Toán rời rạc", "Cấu trúc DL", "Lập trình C", "Cơ sở dữ liệu", "Mạng máy tính"] * 3,
"Điểm": [4.5, 8.0, 3.0, 6.5, 5.9, 4.0, 7.0, 5.0, 9.0, 4.5, 3.0, 6.0, 4.5, 5.5, 7.0],
"Khoa": ["CNTT"] * 15
}
df = pd.DataFrame(data)
Phân tích sinh viên rớt môn
Mục tiêu đầu tiên là xác định số lượt rớt môn, từ đó biết được tổng thể mức độ nghiêm trọng. Theo quy định thông thường, sinh viên sẽ bị xem là rớt môn nếu điểm dưới 5.0. Việc lọc ra các dòng này là bước quan trọng để phục vụ các phân tích tiếp theo.
Ngoài việc xác định ai rớt môn, ta cũng cần biết những môn học nào đang có nhiều lượt rớt nhất. Đây là bước giúp giảng viên và nhà trường tập trung cải tiến các môn học đó hoặc triển khai các chương trình hỗ trợ.
# Lọc sinh viên rớt môn
rot_mon = df[df["Điểm"] < 5.0]
print("Tổng số lượt rớt môn:", len(rot_mon))
# Thống kê rớt theo môn học
mon_rot_nhieu = rot_mon["Môn học"].value_counts()
print(mon_rot_nhieu)
Trực quan hóa dữ liệu rớt môn
Sau khi có bảng thống kê số lượt rớt theo môn, việc trực quan hóa sẽ giúp dễ dàng quan sát và truyền đạt thông tin. Biểu đồ cột là lựa chọn thích hợp để hiển thị dữ liệu dạng phân loại như môn học. Bạn có thể nhanh chóng nhận ra môn nào là “nút thắt cổ chai” trong quá trình học tập của sinh viên.
Ngoài ra, trực quan hóa còn là công cụ hỗ trợ giảng viên, cố vấn học tập, ban giám hiệu nắm bắt nhanh tình hình mà không cần đọc các bảng số liệu khô khan.
import matplotlib.pyplot as plt
mon_rot_nhieu.plot(kind='bar', color='tomato')
plt.title("Thống kê số lượt rớt theo môn học (CNTT)")
plt.xlabel("Môn học")
plt.ylabel("Số lượt rớt")
plt.xticks(rotation=45)
plt.tight_layout()
plt.show()
Phân tích theo từng sinh viên
Bên cạnh việc thống kê rớt theo môn học, một chiều phân tích quan trọng khác là xác định những sinh viên có nguy cơ cao – tức là các sinh viên rớt nhiều môn. Những cá nhân này cần được tư vấn, hỗ trợ học tập sớm nhằm tránh tình trạng mất động lực hoặc bỏ học.
Việc nhóm dữ liệu theo sinh viên sẽ giúp bạn nhìn thấy rõ ai đang “báo động đỏ”, từ đó khoa hoặc cố vấn học tập có thể chủ động can thiệp.

