Công nghệ & AI
CLIP Domain Adapter cho phân loại xe máy: từ ý tưởng đến 97.46% accuracy
Bối cảnh
Bãi xe thực tế là môi trường khó hơn nhiều so với benchmark trong phòng thí nghiệm: ánh sáng thay đổi, góc chụp nghiêng, xe chồng lấn. Mô hình đạt tốt trên ImageNet chưa chắc đã ăn được trên camera bãi xe.
Ý tưởng chính
Thay vì fine-tune lại toàn bộ CLIP, chúng ta gắn một domain adapter nhỏ giữa vision encoder và text encoder. Adapter chỉ học trên vài trăm ảnh của bãi xe thật, giúp CLIP bù sự lệch domain mà không quên tri thức ban đầu.
Kết quả
Sau khi huấn luyện adapter, độ chính xác trên tập kiểm tra thực tế đạt 97.46%, cải thiện ~9 điểm so với CLIP zero-shot. Chi tiết về cách chọn learning rate và nhiệt độ softmax sẽ ở bài sau.