Trong quá trình học và thực hành AI, đặc biệt là deep learning, việc huấn luyện mô hình thường đòi hỏi tài nguyên phần cứng mạnh như GPU. Tuy nhiên, không phải ai cũng có máy tính được trang bị card đồ họa rời. May mắn thay, Google Colab cung cấp một nền tảng tính toán miễn phí trên nền tảng đám mây, giúp bạn có thể huấn luyện mô hình AI ngay cả khi không có GPU cục bộ.
Bài viết này sẽ hướng dẫn bạn cách sử dụng Google Colab để huấn luyện mô hình học máy một cách hiệu quả, kể cả khi bạn không sử dụng GPU. Ngoài ra, chúng ta cũng sẽ điểm qua các mẹo tối ưu thời gian huấn luyện và quản lý dữ liệu một cách thông minh. Nếu bạn từng xem qua các bài như Tạo mô hình học máy với AutoML nhanh chóng, Tạo phân tích dữ liệu ngành học và điểm số, hay So sánh CNN và RNN dùng trong ảnh và chuỗi, thì Google Colab sẽ là công cụ không thể thiếu để hiện thực hóa các ý tưởng mô hình đó.
Giới thiệu Google Colab và các tùy chọn phần cứng
Google Colab là một dịch vụ miễn phí của Google, cho phép bạn chạy mã Python trong môi trường Jupyter Notebook với tài nguyên tính toán đám mây. Bạn có thể chọn phần cứng:
-
CPU (mặc định, phù hợp với bài toán nhỏ hoặc để kiểm thử)
-
GPU (NVIDIA Tesla T4, miễn phí theo thời lượng giới hạn)
-
TPU (xử lý tensor, dùng cho mô hình đặc biệt như Transformer)
Khi không có GPU hoặc không cần GPU, bạn có thể chọn chế độ “None” (chỉ dùng CPU) mà vẫn huấn luyện được mô hình.
Cách bật môi trường không dùng GPU:
-
Vào Runtime → Change runtime type → Hardware accelerator → None để chọn CPU-only.
Tạo mô hình AI đơn giản chạy trên CPU
Để chứng minh hiệu quả huấn luyện trên CPU, ta sẽ xây dựng một mô hình đơn giản sử dụng thư viện scikit-learn hoặc TensorFlow. Việc chọn mô hình đơn giản giúp giảm thiểu thời gian huấn luyện mà vẫn đạt được kết quả trực quan.
Bộ dữ liệu được dùng là Iris Dataset – một bộ dữ liệu kinh điển trong machine learning, chứa thông tin về 3 loại hoa khác nhau. Đây là tập dữ liệu nhỏ, hoàn toàn phù hợp để huấn luyện trên CPU.
Tiếp theo, ta sẽ sử dụng Keras (thuộc TensorFlow) để xây dựng một mạng nơ-ron đơn giản. Mô hình gồm một lớp ẩn và một lớp đầu ra với softmax, phù hợp cho bài toán phân loại đa lớp.
import tensorflow as tf
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import LabelBinarizer
# Load dữ liệu
iris = load_iris()
X = iris.data
y = iris.target
# One-hot encode target
encoder = LabelBinarizer()
y_encoded = encoder.fit_transform(y)
# Tách tập train/test
X_train, X_test, y_train, y_test = train_test_split(X, y_encoded, test_size=0.2, random_state=42)
# Xây mô hình
model = tf.keras.models.Sequential([
tf.keras.layers.Dense(16, input_shape=(4,), activation='relu'),
tf.keras.layers.Dense(3, activation='softmax')
])
# Compile
model.compile(optimizer='adam', loss='categorical_crossentropy', metrics=['accuracy'])
# Train trên CPU
model.fit(X_train, y_train, epochs=50, batch_size=8, verbose=1)
# Đánh giá
loss, acc = model.evaluate(X_test, y_test)
print("Accuracy:", acc)
Một số mẹo tối ưu khi dùng CPU
Khi bạn huấn luyện mô hình trên CPU thay vì GPU, cần áp dụng các kỹ thuật tối ưu để tiết kiệm thời gian và tài nguyên:
-
Dùng mô hình nhỏ gọn: tránh sử dụng mô hình sâu nhiều lớp hoặc với số lượng neuron lớn.
-
Giảm số epoch: dùng
EarlyStoppingđể dừng sớm nếu mô hình không cải thiện. -
Chuẩn hóa dữ liệu: scale dữ liệu đầu vào giúp mô hình hội tụ nhanh hơn.
-
Dùng batch size nhỏ: 8–32 là hợp lý cho CPU.
-
Giảm độ chính xác số học: nếu thư viện hỗ trợ, chuyển từ float32 sang float16.
Quản lý dữ liệu và lưu mô hình trên Google Colab
Colab cho phép bạn lưu dữ liệu, mô hình hoặc tải lên từ máy tính cá nhân:
Lưu và tải dữ liệu qua Google Drive:
from google.colab import drive
drive.mount('/content/drive')

