Khoảng trống trong mô hình hóa nhận thức đối xứng
Đối xứng là một nguyên lý Gestalt nền tảng trong thị giác con người, đóng vai trò then chốt trong phân đoạn hình nền, nhận diện vật thể và phát hiện hình dạng. Mặc dù các thuật toán thị giác máy tính đã đạt được những tiến bộ đáng kể, việc mô phỏng khả năng phát hiện đối xứng của con người vẫn là một thách thức lớn. Các nghiên cứu trước đây thường bị giới hạn bởi số lượng người gán nhãn (annotators) ít ỏi và sự thiếu hụt trong việc nắm bắt các sắc thái tinh tế của nhận thức con người. Hơn nữa, các bộ dữ liệu hiện có thường coi các cấu trúc đối xứng là những thực thể nhị phân (có hoặc không), bỏ qua tính chất "xấp xỉ" hoặc "không hoàn hảo" mà con người vẫn dễ dàng nhận diện trong thực tế. Nghiên cứu này ra đời nhằm lấp đầy khoảng trống đó bằng cách tích hợp nhận thức con người vào cả bộ dữ liệu chuẩn và thước đo đánh giá hiệu năng.
Bản chất của nhận thức đối xứng và thách thức trong thị giác máy tính
Khác với định nghĩa toán học thuần túy, nhận thức đối xứng ở người mang tính linh hoạt cao. Chúng ta có khả năng dung nạp các biến dạng do nhiễu, sự lệch trục (skewing) và các cấu trúc đối xứng lồng ghép. Trong thị giác máy tính, thách thức nằm ở việc các mô hình học sâu (Deep Neural Networks - DNN) thường có xu hướng nhận diện vật thể dựa trên ngữ nghĩa (ví dụ: nhận diện một cái cây hoặc ngôi nhà) thay vì tuân thủ nghiêm ngặt các nguyên tắc hình học của đối xứng. Việc thiếu các bộ dữ liệu quy mô lớn được gán nhãn bởi nhiều người (multi-annotator) khiến các mô hình khó có thể học được "ngữ pháp" của tổ chức thị giác, dẫn đến việc các dự đoán thường bị sai lệch bởi định kiến cá nhân của một người gán nhãn duy nhất.
Dữ liệu và phát hiện cốt lõi từ bộ chuẩn PIX2PER
Nghiên cứu giới thiệu bộ dữ liệu PIX2PER, bao gồm các hình ảnh từ cảnh quan tự nhiên và tác phẩm nghệ thuật, được gán nhãn bởi hơn 900 người tham gia. Nhóm tác giả cũng đề xuất thước đo WF1 (Weighted F1-score), một phiên bản cải tiến của F1-score truyền thống, trong đó các dự đoán được trọng số hóa dựa trên sự đồng thuận của nhiều người gán nhãn. Kết quả cho thấy việc tiền huấn luyện (pretraining) mô hình trên dữ liệu tổng hợp (synthetic data) giúp cải thiện đáng kể khả năng khái quát hóa của các kiến trúc học sâu.
| Mô hình | Tập huấn luyện | Art Img. (WF1) | Natural Img. (WF1) | All Img. (WF1) |
|---|---|---|---|---|
| ResNet-50 | DENDI | 0.228 | 0.257 | 0.242 |
| PMCNet | LDRS | 0.235 | 0.264 | 0.250 |
| EquiSym | DENDI | 0.282 | 0.314 | 0.298 |
| Human Performance | - | 0.388 | 0.397 | 0.392 |
Bình luận chuyên sâu về phương pháp tiếp cận
Việc triển khai một nhóm lớn người gán nhãn giúp giảm thiểu tính chủ quan vốn có trong nhận thức cá nhân, đảm bảo một nền tảng sự thật (ground truth) vững chắc hơn so với các phương pháp truyền thống. Khi dựa vào một quan sát viên duy nhất, các cấu trúc đối xứng hợp lệ thường bị bỏ qua chỉ vì chúng không phải là những điểm nổi bật nhất đối với cá nhân đó.
Kết quả nghiên cứu cho thấy sự nhảy vọt về hiệu năng (khoảng 10%) khi mô hình được tiền huấn luyện với dữ liệu tổng hợp trước khi tinh chỉnh (fine-tuning) trên dữ liệu người dùng. Điều này chứng minh rằng việc tách biệt quá trình học các quy tắc nhận thức cơ bản (như đối xứng) khỏi việc nhận diện vật thể ngữ nghĩa là một chiến lược hiệu quả để phát triển các bộ trích xuất đặc trưng tổng quát.
Thông điệp mang về cho thực hành lâm sàng và nghiên cứu
- Chuyển dịch tư duy: Đối xứng không chỉ là hình học, mà là một hiện tượng nhận thức. Các mô hình thị giác cần được đánh giá dựa trên sự đồng thuận của cộng đồng thay vì chỉ dựa vào một nhãn duy nhất.
- Chiến lược huấn luyện: Việc sử dụng dữ liệu tổng hợp để dạy mô hình các "nguyên lý cơ bản" (Gestalt principles) trước khi đưa vào dữ liệu thực tế là chìa khóa để nâng cao độ chính xác.
- Thước đo mới: Thước đo WF1 cung cấp một cách tiếp cận công bằng hơn, trọng số hóa các dự đoán dựa trên độ tin cậy của sự đồng thuận, giúp đánh giá mô hình sát với thực tế nhận thức của con người hơn.
Tài liệu tham khảo:
Muradás Odriozola, G., Koßmann, L., Tuytelaars, T., & Wagemans, J. (2026). From pixels to perception: A benchmark for human-like symmetry detection. Vision Research, 245, 108825. https://doi.org/10.1016/j.visres.2026.108825
(Tệp gốc: From-pixels-to-perception--A-benchmark-for-human-like-symm_2026_Vision-Resea.pdf)