Mô hình E-Z Reader và Cơ chế Điều hòa Cử động Mắt trong Quá trình Đọc: Sự Kết hợp giữa Xử lý Ngôn ngữ và Mạng lưới Vận động Nhãn cầu

Bs Ngô Hữu Thế
14.9.26
Last Updated

Trong lĩnh vực thần kinh nhãn khoa và khoa học thị giác, việc tìm hiểu cách thức não bộ điều phối cử động mắt (saccades) và khoảng dừng định thị (fixations) khi đọc sách luôn là một chủ đề phức tạp và đầy tranh luận. Khi đọc một dòng chữ, mắt chúng ta không trượt mượt mà qua các từ mà thực hiện các bước nhảy chuyển định thị cực nhanh xen kẽ với các khoảng dừng ngắn để thu nhận thông tin hình ảnh. Câu hỏi cốt lõi đặt ra cho các nhà nghiên cứu là: Điều gì quyết định vị trí mắt sẽ nhảy tới (dừng ở đâu - "where") và thời điểm mắt sẽ rời đi (dừng bao lâu - "when")? Trong nhiều thập kỷ, hai trường phái lý thuyết đối lập đã tồn tại. Trường phái thứ nhất ủng hộ "mô hình xử lý" (processing models), cho rằng quá trình truy xuất từ vựng và hiểu ngôn ngữ giữ vai trò chủ đạo điều khiển vận động nhãn cầu. Ngược lại, trường phái "mô hình vận động nhãn cầu" (oculomotor models) lại lập luận rằng các yếu tố thị giác-vận động cấp thấp cơ bản kiểm soát cử động mắt một cách tự động, còn việc xử lý ngôn ngữ chỉ là hệ quả thụ động theo sau. Việc thiếu hụt một mô hình định lượng chính xác có khả năng mô phỏng đồng thời cả thời gian định thị và vị trí mắt dừng lại đã tạo ra một khoảng trống lớn trong y văn. Chương sách của Keith Rayner, Erik D. Reichle và Alexander Pollatsek (1998) ra đời nhằm giải quyết triệt để vấn đề này thông qua việc hệ thống hóa các dữ liệu thực nghiệm và đề xuất mô hình toán học E-Z Reader.

Bản chất Sinh lý Thị giác và Cơ chế Điều khiển Chuyển động Mắt

Để hiểu rõ cơ chế vận hành của mắt khi đọc, cần phân tách hai quyết định độc lập nhưng liên kết chặt chẽ trong hệ thống vận động nhãn cầu: quyết định vị trí định thị tiếp theo (where) và quyết định thời lượng định thị (when).

1. Cơ chế quyết định vị trí định thị (Where decision):

  • Vị trí quan sát ưu tiên (Preferred Viewing Location - PVL) và Vị trí quan sát tối ưu (Optimal Viewing Position - OVP): Khi mắt chuẩn bị nhảy sang một từ tiếp theo trong vùng thị giác cạnh hoàng điểm (parafovea), mục tiêu lý tưởng về mặt độ nhạy thị giác là tâm của từ đó (OVP), vì điểm này giúp giảm thiểu khoảng cách tối đa từ các chữ cái đến hoàng điểm (fovea). Tuy nhiên, trên thực tế, điểm rơi ban đầu trung bình của mắt (PVL) thường lệch nhẹ về phía giữa đầu từ và trung tâm từ. Sự sai lệch này phản ánh hiện tượng sụt giảm tầm nhảy (undershoot) tự nhiên của hệ thống lập trình vận động nhãn cầu: điểm phóng saccade càng xa từ mục tiêu, mắt càng có xu hướng rơi về phía trước tâm từ và độ biến thiên điểm rơi càng lớn.
  • Vai trò của khoảng trắng (Word Boundaries): Khoảng trắng giữa các từ cung cấp tín hiệu thị giác cấp thấp quan trọng nhất giúp não bộ tính toán độ dài từ và thiết lập biên giới mục tiêu cho chuyển động saccade. Khi loại bỏ khoảng trắng, tốc độ đọc giảm một nửa do suy giảm cả chức năng định hướng cử động mắt lẫn khả năng nhận diện từ.
  • Tác động của yếu tố tâm lý ngôn ngữ: Dù vị trí rơi chi tiết trong từ do chiến lược vận động cấp thấp đảm nhiệm, các quyết định mang tính tổng thể như bỏ qua từ (word skipping) hoặc định thị lại (refixation) lại do các biến số nhận thức điều khiển. Những từ có tần suất xuất hiện cao hoặc tính dự đoán cao trong ngữ cảnh sẽ có xác suất bị bỏ qua cao hơn đáng kể.

2. Cơ chế quyết định thời lượng định thị (When decision):

  • Tốc độ chiết xuất thông tin thị giác: Các thí nghiệm che mặt chữ (visual masking) cho thấy não bộ chỉ cần 50–70 ms đầu tiên của một khoảng dừng định thị để trích xuất đủ thông tin thị giác thô cho quá trình nhận diện từ.
  • Lợi ích xem trước (Preview Benefit): Trong khi mắt đang định thị ở từ $n$, vùng thị giác cạnh hoàng điểm đã bắt đầu xử lý bán phần từ $n+1$. Hiện tượng "xem trước" này giúp rút ngắn thời gian định thị thực tế khi mắt chính thức nhảy sang từ $n+1$ từ 20–60 ms.
  • Tác động trực tiếp từ đặc tính từ vựng: Thời gian định thị (bao gồm Gaze Duration - tổng thời gian định thị trên một từ trước khi chuyển đi, và First Fixation Duration - thời lượng của lần định thị đầu tiên) bị ảnh hưởng trực tiếp ngay lập tức (on-line) bởi độ dài từ, tần suất từ vựng (word frequency), độ mơ hồ nghĩa, và độ phức tạp cú pháp.

3. Kiến trúc vận hành của mô hình E-Z Reader:

Mô hình E-Z Reader giả định rằng quá trình nhận diện từ vựng chính là "động cơ" thúc đẩy mắt tiến về phía trước, được chia thành các giai đoạn nối tiếp:

  • Giai đoạn 1: Kiểm tra độ quen thuộc (Familiarity Check - $M_1$): Là giai đoạn sớm của truy xuất từ vựng. Khi $M_1$ hoàn thành, nó phát một tín hiệu đến hệ thống vận động mắt để bắt đầu lập trình một chuyển động saccade sang từ tiếp theo ($n+1$).
  • Giai đoạn 2: Hoàn tất truy xuất từ vựng (Completion of Lexical Access - $M_2$): Là giai đoạn nhận diện hoàn toàn từ ngữ. Khi $M_2$ hoàn thành, sự chú ý ẩn (covert visual attention) sẽ dịch chuyển sang từ $n+1$, cho phép bắt đầu xử lý xem trước từ này.
  • Giai đoạn 3: Lập trình vận động nhãn cầu khả biến (Labile Saccadic Programming - $A_1$): Giai đoạn lập trình chuyển động mắt sớm, có thể bị hủy bỏ nếu một chương trình saccade mới được kích hoạt.
  • Giai đoạn 4: Lập trình vận động nhãn cầu bất biến (Nonlabile Saccadic Programming - $A_2$): Giai đoạn lập trình muộn, không thể can thiệp hay hủy bỏ.
  • Giai đoạn 5: Thực thi Saccade ($S$): Chuyển động mắt vật lý diễn ra.

Dữ liệu Thực nghiệm và Bằng chứng Mô phỏng từ Mô hình E-Z Reader

Để kiểm chứng tính chính xác của mô hình E-Z Reader, Rayner và cộng sự đã sử dụng tập dữ liệu thực nghiệm chuẩn từ nghiên cứu của Schilling, Rayner và Chumbley (1998) trên 48 câu văn (độ dài 8–14 từ) được đọc bởi người trưởng thành. Toàn bộ các từ trong tập dữ liệu được phân thành 5 nhóm tần suất từ vựng (từ nhóm 1: rất hiếm, 1–10 lần/triệu từ, đến nhóm 5: rất phổ biến, >10,000 lần/triệu từ).

Kết quả so sánh giữa số liệu thực nghiệm quan sát được (Observed) và giá trị dự đoán từ mô hình toán học E-Z Reader (Predicted) được tóm tắt trong bảng dưới đây:

Nhóm tần suất từTần suất trung bình (/triệu từ)Gaze Duration (ms) [Obs / Pred]First Fixation Duration (ms) [Obs / Pred]Single Fixation Duration (ms) [Obs / Pred]Xác suất Bỏ qua từ (Skipping) [Obs / Pred]Xác suất Định thị 1 lần [Obs / Pred]Xác suất Định thị 2 lần [Obs / Pred]
Nhóm 1 (1–10)3293 / 291248 / 251265 / 2740.10 / 0.090.68 / 0.730.20 / 0.17
Nhóm 2 (11–100)45272 / 271234 / 253249 / 2630.13 / 0.160.70 / 0.760.16 / 0.07
Nhóm 3 (101–1,000)347256 / 257228 / 246243 / 2520.22 / 0.270.68 / 0.680.10 / 0.04
Nhóm 4 (1,001–10,000)4,889234 / 226223 / 223235 / 2240.55 / 0.490.44 / 0.500.02 / 0.01
Nhóm 5 (10,001+)40,700214 / 211208 / 210216 / 2100.67 / 0.680.32 / 0.320.01 / 0.00

Bên cạnh việc tái hiện xuất sắc thời gian định thị trung bình, mô hình E-Z Reader còn giải thích được hai hiện tượng tinh vi trong tâm lý ngôn ngữ học:

  • Hiệu ứng tràn (Spillover Effect): Khi đọc một từ khó (tần suất thấp, từ $n$), thời gian định thị trên từ tiếp theo ($n+1$) cũng bị kéo dài thêm. E-Z Reader giải thích rằng từ $n$ khó sẽ làm kéo dài giai đoạn $M_2$, làm chậm sự dịch chuyển chú ý sang từ $n+1$, dẫn đến giảm lợi ích xem trước (preview benefit) của từ $n+1$. Mô hình dự đoán hiệu ứng tràn là 22 ms (so với thực nghiệm từ 30–50 ms).
  • Dự đoán Lợi ích Xem trước (Preview Benefit Simulation): Mô hình dự đoán việc mất thông tin xem trước ở vùng cạnh hoàng điểm làm tăng Gaze Duration lên 40 ms, khớp hoàn hảo với khoảng thực nghiệm quan sát (40–60 ms).

Phân tích Chuyên sâu và Ranh giới Lý thuyết giữa Các Mô hình

Sự thành công của mô hình E-Z Reader nằm ở việc tách rời tín hiệu dịch chuyển chú ý ($M_2$) khỏi tín hiệu bắt đầu lập trình cử động mắt ($M_1$). Khác với mô hình của Morrison (1984) vốn gắn chặt hai quá trình này làm một, E-Z Reader giải thích được tại sao mắt có thể thực hiện các bước nhảy bỏ qua từ (skipping) mà không tạo ra sự bất hợp lý về thời gian.

"Điểm đột phá của E-Z Reader chính là việc chứng minh rằng quá trình nhận diện từ vựng hoạt động như một 'động cơ' điều khiển mắt tiến về phía trước, trong đó kiểm tra độ quen thuộc sơ bộ là ngòi nổ phát động chuyển động mắt, còn sự hoàn tất truy xuất từ vựng mới là chìa khóa mở đường cho sự chú ý dịch chuyển sang mục tiêu tiếp theo."

Tuy nhiên, các tác giả cũng thẳng thắn chỉ ra những hạn chế cố hữu của mô hình E-Z Reader cũng như các mô hình cùng thời:

  • Chưa giải thích tọa độ rơi chi tiết nội từ: E-Z Reader hiện tại là một mô hình xử lý nhận thức thuần túy (process model), dự đoán từ nào được định thị và dừng bao lâu, chứ chưa tích hợp các phương trình mô phỏng tọa độ chữ cái chính xác mà mắt sẽ rơi vào trong từ đó.
  • Bỏ qua xử lý cú pháp và ngữ nghĩa cấp cao: Mô hình chưa tính đến các cử động mắt quay lại (regressions) do hiểu sai cú pháp (hiệu ứng "garden-path") hoặc xử lý đại từ thay thế (anaphora). Các tác giả nhận định rằng xử lý cấp cao chỉ can thiệp và tạm dừng hệ thống vận động mắt thông thường khi người đọc gặp trở ngại nghiêm trọng về mặt hiểu văn bản.
  • Giản đơn hóa cấu trúc hình thái từ (Morphemic effects): Các dữ liệu nghiên cứu trên tiếng Phần Lan (Hyönä & Pollatsek, 1998) cho thấy độ dài và tần suất của các thái lặp/hình thái từ cấu tạo nên từ ghép có ảnh hưởng rõ rệt đến vị trí định thị lại, điều mà E-Z Reader chưa mô phỏng được.

Thông điệp Ứng dụng Thực hành và Định hướng Lâm sàng

  • Cơ sở cho chẩn đoán rối loạn đọc (Dyslexia) và nhược thị (Amblyopia): Việc hiểu rõ cử động mắt khi đọc được điều khiển trực tiếp bởi tốc độ truy xuất từ vựng ($M_1, M_2$) giúp các bác sĩ thần kinh nhãn khoa phân biệt giữa rối loạn đọc do tổn thương đường truyền vận động nhãn cầu thuần túy và rối loạn đọc do suy giảm xử lý ngôn ngữ/thị giác trung ương.
  • Ứng dụng trong Phục hồi chức năng thị giác (Visual Rehabilitation): Ở bệnh nhân giảm thị lực trung tâm (như thoái hóa hoàng điểm), khả năng xem trước ở vùng cạnh hoàng điểm bị mất. Bài tập phục hồi cần tập trung vào việc tối ưu hóa điểm định thị lệch tâm (PRL) để khôi phục hiệu ứng xem trước, từ đó giảm thời gian định thị và cải thiện tốc độ đọc.
  • Đánh giá chức năng vận động nhãn cầu nâng cao: Khi thăm dò vận động mắt ở người bệnh, cần lưu ý rằng khoảng dừng định thị ngắn bất thường hay hiện tượng nhảy cóc từ không hẳn là lỗi cơ học của cơ vận nhãn, mà có thể là phản ánh của quá trình xử lý nhận thức thần kinh đang diễn ra cực nhanh hoặc bị đứt gãy.

Tài liệu tham khảo:

Rayner, K., Reichle, E. D., & Pollatsek, A. (1998). Eye movement control in reading: An overview and model. In G. Underwood (Ed.), Eye Guidance in Reading and Scene Perception (pp. 243–268). Elsevier Science Ltd.

Xem thêm