Mô phỏng Cử động Mắt khi Đọc: Từ Kiến trúc E-Z Reader đến Cơ chế Xử lý Thị giác - Ngôn ngữ Cấp cao

Bs Ngô Hữu Thế
5.9.26
Last Updated

Đọc thầm (silent reading) là một trong những kỹ năng nhận thức phức tạp và tần suất thực hiện cao nhất ở người trưởng thành. Trong nhiều thập kỷ của thế kỷ 20, từng tồn tại quan niệm cho rằng sự di chuyển của nhãn cầu khi đọc diễn ra quá nhanh và mang tính cơ học, không thể phản ánh kịp thời các tiến trình xử lý nhận thức diễn ra trong bộ não con người. Tuy nhiên, sự phát triển của công nghệ ghi nhận cử động mắt (eye-tracking) đã chứng minh điều ngược lại: các mẫu vận động nhãn cầu theo từng thời điểm (moment-to-moment)—bao gồm thời gian dừng mắt (fixation duration) và vị trí hoàng điểm hạ cánh (landing position)—chịu sự điều khiển trực tiếp và vô cùng nhạy bén bởi các thuộc tính ngôn ngữ của văn bản, chẳng hạn như tần suất xuất hiện của từ (word frequency) hay độ dự đoán được của từ trong ngữ cảnh (predictability).

Dù các thực nghiệm đã ghi nhận hàng loạt biến số ảnh hưởng đến cử động mắt, việc dừng lại ở các mô tả định tính là chưa đủ để giải thích bản chất tương tác giữa hệ thống thị giác, sự chú ý (attention) và hệ thống vận động nhãn cầu (oculomotor system). Câu hỏi then chốt đặt ra cho các nhà khoa học thần kinh thị giác và tâm lý học nhận thức là: Bản chất cơ chế tính toán và sinh lý thần kinh nào điều phối nhịp nhàng việc trích xuất thông tin thị giác ở vùng hoàng điểm - cận hoàng điểm (foveal/parafoveal visual processing) và lập trình các vận động nhảy mắt (saccades) trong thời gian thực? Mô hình E-Z Reader được phát triển nhằm cung cấp một khung lý thuyết tính toán định lượng (quantitative computational model) để giải mã chính xác các ràng buộc sinh lý và nhận thức này.

Kiến trúc nền tảng và cơ chế điều khiển vận động nhãn cầu trong mô hình E-Z Reader

Về mặt bản chất, mô hình E-Z Reader giả định rằng "động cơ" chính thúc đẩy mắt tiến về phía trước trong văn bản là tiến trình nhận diện từ theo chuỗi tuần tự (serial word identification). Chú ý thị giác được phân bổ tuần tự cho từng từ một, thay vì xử lý song song nhiều từ cùng lúc trên diện rộng. Điểm tinh tế nhất của mô hình nằm ở sự tách biệt giữa tín hiệu lập trình chuyển động mắt và tín hiệu chuyển dịch sự chú ý.

Tiến trình nhận diện một từ ($word_n$) được chia thành hai giai đoạn nhận thức chính:

  • Giai đoạn kiểm tra độ quen thuộc (Familiarity Check - $L_1$): Là thời điểm lối vào hình thái từ (orthographic entry) được kích thích đến một ngưỡng an toàn. Khi giai đoạn $L_1$ hoàn tất, một tín hiệu lập tức được gửi đến hệ thống vận động nhãn cầu để bắt đầu lập trình một nhịp nhảy mắt (saccade) hướng tới từ tiếp theo ($word_{n+1}$).
  • Giai đoạn hoàn tất từ vựng (Lexical Completion - $L_2$): Là khi toàn bộ thông tin hình thái, âm vận và ngữ nghĩa của từ được xử lý triệt để. Khi $L_2$ hoàn tất, điểm tập trung của sự chú ý thị giác mới chính thức dịch chuyển sang từ tiếp theo ($word_{n+1}$).

Sự chênh lệch thời gian giữa $L_1$ và $L_2$ giải thích cho hiện tượng "tràn kết quả" (spillover effect)—nơi thuộc tính của từ trước đó vẫn ảnh hưởng đến thời gian dừng mắt ở từ kế tiếp. Đồng thời, hệ thống vận động nhãn cầu lập trình cử động mắt theo hai pha: pha không ổn định (labile stage - $M_1$) và pha cố định (non-labile stage - $M_2$). Nếu trong thời gian pha $M_1$ đang diễn ra mà có một lệnh vận động mới được tạo ra (ví dụ: $word_{n+1}$ được xử lý quá nhanh làm hoàn tất $L_1$ sớm), lệnh vận động ban đầu sẽ bị hủy bỏ (cancellation). Cơ chế hủy lệnh này—dựa trên nguyên lý thực nghiệm bước đôi của Becker & Jürgens (1979)—chính là chìa khóa giải thích hiện tượng bỏ qua từ (word skipping) khi đọc.

Bên cạnh đó, vị trí mắt hạ cánh trên một từ không hoàn toàn chính xác do sai số hệ thống (systematic error - xu hướng nhảy ngắn hơn mục tiêu nếu khoảng cách xa và vượt mục tiêu nếu khoảng cách ngắn) và sai số ngẫu nhiên (random error). Khi mắt hạ cánh lệch khỏi vị trí quan sát tối ưu (Optimal Viewing Position - thường ở tâm từ), tốc độ trích xuất thông tin thị giác bị giảm do độ phân giải của võng mạc suy giảm dần từ hoàng điểm ra ngoại vi (visual acuity limitations).

Chuyển đổi từ E-Z Reader 5 đến E-Z Reader 7 và mở rộng mô hình cho từ ghép phức tạp

Trong các phiên bản đầu tiên như E-Z Reader 5, thời gian dừng mắt đầu tiên (first fixation duration) trên các từ có tần suất thấp bị mô phỏng ngắn một cách bất thường do cuộc đua (race) giữa lệnh hủy tái định vị và kiểm tra độ quen thuộc. Để khắc phục triệt để lỗ hổng này và gia tăng tính chính xác sinh lý, mô hình E-Z Reader 7 đã giới thiệu hai nâng cấp mang tính bước ngoặt:

  1. Giai đoạn tiền xử lý thị giác (Pre-attentive visual stage): Bổ sung giai đoạn thu nhận thông tin hình thái thô trước khi bắt đầu kiểm tra độ quen thuộc. Giai đoạn này phụ thuộc hoàn toàn vào đặc tính vật lý (chiều dài từ, số lượng chữ cái) và độ lệch tâm so với hoàng điểm (eccentricity), giúp E-Z Reader 7 tái hiện chính xác ảnh hưởng của độ dài từ (word length effect).
  2. Lập trình tái định vị song song (Parallel refixation programming): Lệnh nhảy mắt tạo nhịp dừng thứ hai trên cùng một từ được lập trình song song ngay từ đầu dựa trên chiều dài và độ dự đoán của từ, thay vì phải chờ mắt hạ cánh mới bắt đầu lập trình.

Để kiểm tra tính tổng quát của mô hình, các tác giả đã mở rộng E-Z Reader 7 trên ngữ cảnh ngôn ngữ phức tạp hơn: từ ghép 12 chữ cái trong tiếng Phần Lan (Finnish compound words). Bằng thực nghiệm so sánh giữa mô hình đua song song hai tuyến (parallel horse-race model) và mô hình cấu thành hình thái tuần tự (serial morphemic composition model - E-Z Reader 7E), dữ liệu đã bác bỏ giả thuyết đua song song và khẳng định hệ thống thị giác - ngôn ngữ xử lý các thành tố từ ghép (constituents) theo trình tự tuyến tính từ trái sang phải, kết hợp với một giai đoạn "gắn kết hình thái" (morphemic glue time) ở cuối tiến trình.

Bảng dưới đây tóm tắt sự tương quan giữa dữ liệu thực nghiệm quan sát thực tế và dự báo tính toán từ mô hình E-Z Reader 7E trên các chuỗi từ ghép tiếng Phần Lan:

Chỉ số vận động mắtThành tố 1: Tần suất thấp (Observed / Predicted)Thành tố 1: Tần suất cao (Observed / Predicted)Thành tố 2: Tần suất thấp (Observed / Predicted)Thành tố 2: Tần suất cao (Observed / Predicted)
Thời gian nhìn tổng cộng (Gaze duration - ms)522 / 567435 / 490626 / 625531 / 564
Thời gian dừng mắt đầu tiên (1st fixation dur. - ms)197 / 194188 / 175215 / 178214 / 180
Xác suất dừng mắt lần 2 (Prob. of 2nd fix.)0.87 / 0.990.85 / 0.970.91 / 1.000.88 / 0.99
Xác suất dừng mắt lần 3 (Prob. of 3rd fix.)0.45 / 0.610.30 / 0.460.58 / 0.910.44 / 0.84

Đánh giá chuyên sâu và tính tương thích với sinh lý thần kinh thị giác

Các hằng số thời gian được thiết lập trong E-Z Reader 7 cho thấy sự phù hợp kinh ngạc với các dữ liệu sinh lý thần kinh đã biết về đường truyền thị giác. Thời gian tối thiểu để tín hiệu thị giác đi từ võng mạc qua thể gối ngoài (LGN) đến vỏ não thị giác sơ cấp (V1) mất khoảng 90 ms. Các nghiên cứu điện thế gợi liên quan đến sự kiện (ERP) chỉ ra rằng thời gian tối thiểu để nhận diện một từ ngắn, quen thuộc nằm trong khoảng 125–180 ms (Sereno et al., 1998). Thời gian mô hình E-Z Reader 7 tính toán để hoàn tất nhận diện từ hoàn toàn phù hợp với khung thời gian sinh lý này (đạt trung bình khoảng 142 ms đối với từ cực kỳ phổ biến như "the").

Đồng thời, độ trễ lập trình vận động nhãn cầu trong mô hình là 245 ms, hoàn toàn tương thích với thời gian phản ứng nhãn cầu thực nghiệm trong các nhiệm vụ quan sát điểm sáng liên tiếp của Becker & Jürgens (285 ms). Điều này chứng minh rằng nhận diện từ hoàn toàn có thể đóng vai trò là tín hiệu trực tiếp điều khiển nhịp nhảy mắt mà không cần phải giả định các khoảng thời gian trễ vận động ngắn một cách phi lý.

"Mô hình hóa định lượng không chỉ đơn thuần là việc khớp các đường cong dữ liệu (curve fitting). Giá trị cốt lõi của E-Z Reader nằm ở chỗ nó buộc chúng ta phải cụ thể hóa các giả thuyết mơ hồ thành các tham số thời gian thực, từ đó bác bỏ những mô hình định tính dường như 'hiển nhiên'—như mô hình đua song song hai tuyến trong nhận diện từ ghép—để đưa ra bản chất vận hành tuần tự mang tính tối ưu của bộ não."

Mặc dù E-Z Reader 7 vô cùng thành công trong việc giải thích các biến số ở cấp độ từ ngữ, cạm bẫy của mô hình hiện tại là chưa tích hợp triệt để sự ảnh hưởng chiều sâu của các yếu tố cú pháp (syntax) và ngữ nghĩa đoạn văn (discourse processing). Các tiến trình xử lý cấp cao này thường vận hành ở hậu trường và chỉ can thiệp làm gián đoạn dòng di chuyển nhãn cầu (gây ra hiện tượng nhảy mắt ngược - regression) khi bộ não gặp phải khó khăn trong việc hiểu ý nghĩa toàn câu.

Thông điệp cốt lõi ứng dụng trong nghiên cứu thị giác và lâm sàng

  • Phân bổ chú ý thị giác là tuyến tính tuần tự: Mặc dù thông tin thị giác thô được tiếp nhận đồng thời trên võng mạc, điểm tập trung chú ý nhận thức (attentional spotlight) di chuyển theo chuỗi tuần tự từng từ một trước khi cử động mắt diễn ra.
  • Tách biệt giữa lập trình vận động và dịch chuyển chú ý: Hoàn tất giai đoạn kiểm tra độ quen thuộc ($L_1$) phát tín hiệu di chuyển nhãn cầu, trong khi hoàn tất xử lý ngôn ngữ sâu ($L_2$) mới phát tín hiệu chuyển dịch chú ý sang vị trí mới.
  • Cơ chế xử lý từ phức/từ ghép: Bộ não xử lý các từ ghép dài bằng cách chia nhỏ thành các thành tố hình thái và xử lý tuần tự từ trái sang phải, sau đó thực hiện giai đoạn "gắn kết hình thái" phụ thuộc vào tần suất của toàn bộ từ.
  • Chẩn đoán và đánh giá chức năng đọc lâm sàng: Sự bất thường trong mẫu cử động mắt (thời gian dừng mắt kéo dài, tỷ lệ refixation cao hoặc nhảy lặp lại) phản ánh sự nghẽn mạch ở giai đoạn $L_1$ (trích xuất hình thái/thị giác) hoặc $L_2$ (truy xuất từ vựng), cung cấp cơ sở để đánh giá các rối loạn đọc như chứng khó đọc (dyslexia) hoặc tổn thương đường truyền thị giác - nhận thức.

Tài liệu tham khảo:

Pollatsek, A., Reichle, E. D., & Rayner, K. (2003). Modeling Eye Movements in Reading: Extensions of the E-Z Reader Model. In J. Hyönä, R. Radach, & H. Deubel (Eds.), The Mind's Eye: Cognitive and Applied Aspects of Eye Movement Research (pp. 361-390). Elsevier Science BV. ISBN: 0-444-51020-6.

Xem thêm