Nghiên cứu phát triển mô hình mạng nơ ron nhân tạo học sâu và ứng dụng vào một số bài toán phát hiện đối tượng
Cập nhật vào: Thứ ba - 09/06/2026 00:07
Cỡ chữ
PGS. TS. Phạm Thế Anh và các cộng sự tại Trường Đại học Hồng Đức đã hoàn thành đề tài nghiên cứu về mạng nơ-ron tích chập học sâu (CNN). Mục tiêu chính của đề tài là xây dựng các kiến trúc mạng tối ưu về tốc độ và độ chính xác để triển khai trên các máy tính cấu hình thấp, giá thành rẻ tại Việt Nam.

Sau 24 tháng, đề tài đã xây dựng được hai bộ dữ liệu quan trọng:
- Bộ dữ liệu biển số xe Việt Nam: Gồm 30.000 ảnh (20.000 ô tô, 10.000 xe máy). Dữ liệu được thu thập trực tiếp tại bãi xe, đường phố trong nhiều điều kiện: xe di chuyển, thiếu sáng, trời mưa. Bộ dữ liệu này giải quyết được đặc thù biển số Việt Nam như: số ký tự thay đổi (5-9 ký tự), màu nền (xanh, đỏ, trắng) và loại biển một hoặc hai hàng.
- Bộ dữ liệu động thực vật quý hiếm: Gồm 33.000 ảnh của 36 loài động vật và 21 loài thực vật tại các khu bảo tồn ở Thanh Hóa. Ảnh chụp chi tiết các bộ phận (thân, lá, gốc, đuôi...) ở nhiều góc độ và giai đoạn phát triển khác nhau.
Nhóm nghiên cứu đã đề xuất và công bố nhiều kiến trúc mạng hiệu quả trên các tạp chí quốc tế (SCIE):
- Dò tìm khuôn mặt (Mạng SCBox): Sử dụng kiến trúc Semantic Convolutional Box để học đặc trưng ngữ cảnh. Mô hình đạt độ chính xác 96,8% trên tập dữ liệu FDDB. Tốc độ xử lý đạt 106 FPS trên GPU và 20 FPS trên CPU thông dụng.
- Nhận dạng biển số xe: Đề xuất kiến trúc loại bỏ tầng Max-Pooling để hạn chế mất mát thông tin. Hệ thống đạt độ chính xác dò tìm 98,1% và nhận dạng 96,22% trên tập dữ liệu CCPD. Trên máy CPU cấu hình thấp (Core i3-6100U), hệ thống đạt tốc độ 33,6 FPS.
- Nhận dạng động thực vật: Mô hình gọn nhẹ gồm 9 tầng tích chập và 6 tầng Inception Residual. Độ chính xác đạt 97,6%. Khi triển khai trên di động (Android, iOS), thời gian dự đoán chỉ mất khoảng 175ms, phù hợp cho việc giám sát thực địa của kiểm lâm.
- Dò tìm người (Human Detection): Sử dụng phép tích chập khả tách theo chiều sâu (Depthwise Separable Convolution) để giảm độ phức tạp tính toán từ 8-9 lần. Mô hình đạt tốc độ 150 FPS trên GPU trung bình với độ chính xác 73,8% trên tập dữ liệu WiderPerson.
Kết quả nghiên cứu cho thấy các mô hình đề xuất có khả năng tự động học đặc trưng hiệu quả mà không cần phân vùng thủ công. Đặc biệt, phương pháp nhận dạng biển số không phụ thuộc vào định dạng (layout-invariant) giúp xử lý tốt các loại biển có số ký tự và kích thước thay đổi. Đề tài đã chứng minh việc ứng dụng AI học sâu trên các thiết bị phần cứng hạn chế tại Việt Nam là hoàn toàn khả thi.
Có thể tìm đọc toàn văn báo cáo kết quả nghiên cứu (mã số 21580/2022) tại Cục Thông tin, Thống kê.
P.T.T (NASTIS)
Liên hệ
Tiếng Việt
Tiếng Anh











