Bạn là sinh viên mới tiếp cận trí tuệ nhân tạo và cần một đề tài đơn giản để bắt đầu? Bạn muốn làm một đồ án AI thực tế, không quá khó, có dữ liệu sẵn và không cần viết quá nhiều code?
Vậy thì lựa chọn scikit-learn – một thư viện Python cực kỳ phổ biến và dễ dùng – là hướng đi rất thông minh. Trong bài viết này, bạn sẽ được hướng dẫn từng bước để làm một đồ án AI đơn giản dùng dữ liệu có sẵn, với đầy đủ pipeline: từ xử lý dữ liệu, huấn luyện mô hình, đánh giá và dự đoán.
Dự án mẫu: Dự đoán loại hoa Iris
Iris dataset là một trong những bộ dữ liệu kinh điển và dễ hiểu nhất trong học máy. Bộ dữ liệu gồm các đặc trưng về hoa như chiều dài và chiều rộng cánh, đài hoa, mục tiêu là dự đoán hoa thuộc loại nào.
Cấu trúc dữ liệu gồm:
-
sepal length (cm)
-
sepal width (cm)
-
petal length (cm)
-
petal width (cm)
-
label: loại hoa (Setosa, Versicolor, Virginica)
Bạn không cần tải từ ngoài, vì scikit-learn đã tích hợp sẵn bộ dữ liệu này.
Cài đặt thư viện
Trước khi bắt đầu, bạn hãy cài những thư viện cần thiết:
pip install scikit-learn pandas matplotlib seaborn joblib
Tạo cấu trúc thư mục gọn gàng:

