blog.dopana

Back

QLoRA (Quantized Low-Rank Adaptation) mang khả năng tinh chỉnh các mô hình hàng chục tỷ tham số lên các GPU phổ thông dành cho người dùng cá nhân (như RTX 3090/4090).

Đột phá từ QLoRA#

QLoRA giới thiệu 3 cải tiến chính:

  1. NF4 (NormalFloat4): Kiểu dữ liệu lượng hóa 4-bit tối ưu cho các ma trận trọng số tuân theo phân phối chuẩn.
  2. Double Quantization: Lượng hóa chính các hằng số lượng hóa (quantization constants), tiết kiệm trung bình 0.37 bit mỗi tham số.
  3. Paged Optimizers: Tự động chuyển đổi memory state của GPU sang CPU RAM khi vRAM bị quá tải.

Thực hành fine-tune với BitsAndBytes#

Kết luận & Lời khuyên#

Fine-tuning không còn là đặc quyền của các tập đoàn công nghệ lớn. Kết hợp QLoRA, PEFT và BitsAndBytes, bạn hoàn toàn có thể tinh chỉnh mô hình phù hợp với bài toán của riêng mình ngay trên thiết bị cá nhân.

Tài liệu tham khảo#