Sự gắn kết giữa Ánh mắt và Lời nói: Ứng dụng Kỹ thuật Theo dõi Chuyển động Mắt (Eye Tracking) trong Nghiên cứu Sản xuất Ngôn ngữ

Bs Ngô Hữu Thế
5.9.26
Last Updated

Trong suốt nhiều thập kỷ, tâm lý học ngôn ngữ (psycholinguistics) đã sử dụng kỹ thuật theo dõi chuyển động mắt (eye tracking) như một công cụ sắc bén để giải mã các tiến trình nhận thức, đặc biệt trong lĩnh vực nhận diện từ ngữ qua thị giác, đọc hiểu và hiểu ngôn ngữ qua thính giác. Tuy nhiên, việc áp dụng công nghệ này vào nghiên cứu sản xuất ngôn ngữ (language production) từng gặp phải rào cản kỹ thuật lớn: các hệ thống eye tracking truyền thống bắt buộc người tham gia phải ngồi cố định tuyệt đối bằng gông cằm (chin rest) hoặc thanh cắn (bite bar) — điều này gây cản trở trực tiếp đến chuyển động cơ học của cơ quan phát âm (articulation). Sự ra đời của các hệ thống theo dõi chuyển động mắt thế hệ mới cho phép đầu và cơ thể cử động tự do đã mở ra một kỷ nguyên mới, giúp các nhà khoa học quan sát trực tiếp mối tương quan thời gian thực (on-line) giữa sự chú ý thị giác và tiến trình lập kế hoạch phát ngôn.

Phương pháp đo thời gian phản ứng truyền thống — chẳng hạn như phân tích độ trễ bắt đầu phát ngôn (speech onset latency) hay phân tích lỗi phát ngôn (speech errors) — dù mang lại nhiều hiểu biết quan trọng về cách truy xuất một từ đơn lẻ, lại bộc lộ hạn chế rõ rệt khi nghiên cứu các cụm từ hoặc câu phức hợp. Độ trễ bắt đầu nói chỉ phản ánh giai đoạn lập kế hoạch diễn ra trước khi âm thanh đầu tiên cất lên, hoàn toàn "mù" đối với các tiến trình nhận thức nối tiếp diễn ra sau khi nói. Trong khi đó, các lỗi phát ngôn (như nói nhầm vị trí từ) lại chỉ đại diện cho những trường hợp hệ thống lập kế hoạch bị chệch hướng, thay vì phản ánh sự phối hợp trơn tru của một bộ máy ngôn ngữ bình thường. Việc đưa eye tracking vào nghiên cứu sản xuất ngôn ngữ đã lấp đầy khoảng trống này, cho phép chúng ta theo dõi song song cả quá trình chuẩn bị trước khi nói và quá trình điều khiển nhận thức trong suốt thời gian phát ngôn.

Bản chất sinh lý thần kinh và các mô hình phối hợp thời gian trong sản xuất ngôn ngữ

Để hiểu tại sao ánh mắt lại phản ánh chính xác tiến trình lập kế hoạch lời nói, cần phân tích bản chất của quá trình định danh đối tượng (object naming). Theo mô hình lý thuyết chuẩn về sản xuất từ đơn (như mô hình WEAVER++ của Levelt, Roelofs và Meyer), quá trình chuyển đổi từ một hình ảnh thị giác thành âm thanh phát ra trải qua các giai đoạn nối tiếp riêng biệt:

  • Tiến trình Thị giác - Khái niệm (Visual-Conceptual Processes): Nhận diện đối tượng thị giác và kích hoạt khái niệm tương ứng trong bộ nhớ.
  • Truy xuất Từ vựng (Lexical Access): Bao gồm chọn lọc lemma (đơn vị từ vựng mang thông tin cú pháp và ngữ nghĩa) và mã hóa hình thái học (morphological encoding - lựa chọn các hình thái cấu tạo nên từ).
  • Mã hóa Âm tiết & Ngữ âm (Phonological & Phonetic Encoding): Lựa chọn các phụ âm, nguyên âm, gán trọng âm, âm tiết hóa và tạo ra các lệnh vận động phát âm (articulatory commands).
  • Phát âm (Articulation): Cơ quan phát âm thực thi các lệnh vận động để tạo ra âm thanh.

Khi một người cần gọi tên nhiều đối tượng liên tiếp (ví dụ: "con mèo và cái ghế"), câu hỏi cốt lõi đặt ra là: Bộ não phối hợp thời gian cho các chuỗi tiến trình này giữa các từ như thế nào? Y văn đưa ra hai giả thuyết đối lập:

Giả thuyết Nối tiếp (Serial Hypothesis): Người nói tập trung ánh mắt vào đối tượng thứ nhất cho đến khi tên của nó được lập kế hoạch hoàn chỉnh (đến mức mã hóa âm tiết hoặc chuẩn bị lệnh phát âm), sau đó mới chuyển hướng nhìn sang đối tượng thứ hai. Thời gian phát âm của từ thứ nhất sẽ được tận dụng để hoàn thiện kế hoạch cho từ thứ hai, giúp giảm thiểu sự chồng chéo thời gian giữa các tiến trình nhận thức của hai đối tượng khác nhau.

Giả thuyết Song song (Parallel Hypothesis): Người nói bắt đầu xử lý đối tượng mới càng sớm càng tốt để tối đa hóa sự chồng chéo thời gian. Dù phân tích thị giác - khái niệm ban đầu có thể phải diễn ra nối tiếp, quá trình truy xuất từ vựng cho nhiều từ có thể chạy song song đồng thời.

Bằng chứng thực nghiệm và các phát hiện cốt lõi từ dữ liệu Eye Tracking

Các thực nghiệm do Meyer, Sleiderink & Levelt (1998) và các cộng sự thực hiện đã cung cấp những bằng chứng thực nghiệm quan trọng giúp phân định hai giả thuyết này. Khi người tham gia gọi tên các cặp đối tượng từ trái sang phải, chuyển động mắt cho thấy một quy luật vô cùng chặt chẽ: người nói hầu như luôn cố định ánh mắt (fixate) vào từng đối tượng theo đúng thứ tự được đề cập trong lời nói, và mắt luôn đi trước lời nói một khoảng thời gian nhất định (khoảng 500–600 ms).

Chỉ số quan trọng nhất được ghi nhận là Thời gian nhìn (Viewing Time) — khoảng thời gian từ khi bắt đầu điểm dừng mắt đầu tiên trên đối tượng cho đến khi mắt bắt đầu nhảy (saccade) sang đối tượng tiếp theo. Bằng cách thao tác các biến số ảnh hưởng đến từng giai đoạn xử lý ngôn ngữ khác nhau, các tác giả đã phát hiện:

  • Ảnh hưởng của chất lượng hình ảnh (Thị giác - Khái niệm): Hình ảnh bị làm suy giảm nét (degraded) làm tăng thời gian nhìn lên 15 ms so với hình ảnh rõ nét. Điều này chứng minh người nói chưa chuyển mắt đi nếu chưa hoàn thành phân tích thị giác - khái niệm.
  • Ảnh hưởng của Tần suất Từ (Morphological Encoding): Các đối tượng có tên mang tần suất xuất hiện cao (high frequency) có thời gian nhìn ngắn hơn 34 ms so với từ tần suất thấp. Điều này cho thấy mắt chỉ rời khỏi đối tượng sau khi hình thái học của từ đã được truy xuất.
  • Ảnh hưởng của Tương tác Ngữ âm (Phonological Encoding): Khi chèn từ nhiễu qua thính giác có liên quan về âm tiết (phonologically related distractor), thời gian nhìn giảm 50 ms, khẳng định mắt cố định trên đối tượng cho đến khi dạng ngữ âm của từ được tạo lập hoàn chỉnh.
  • Cấu trúc Cụm từ Phức hợp: Khi người nói phải gọi tên đối tượng bằng cụm danh từ phức hợp (ví dụ: "quả bóng nhỏ màu xanh" thay vì "quả bóng"), độ trễ bắt đầu nói không thay đổi nhiều, nhưng thời gian nhìn tăng hơn gấp đôi. Phân tích chi tiết cho thấy chuyển động mắt sang đối tượng tiếp theo luôn được kích hoạt khoảng 250 ms trước khi phát âm từ cuối cùng của cụm từ (phrase-final word).

Đối với tác vụ mô tả ngữ cảnh hoặc sự kiện phức tạp (ví dụ: "chàng cao bồi đưa chiếc mũ cho chú hề"), hành vi nhìn trải qua hai giai đoạn rõ rệt: Giai đoạn Đánh giá/Khái niệm hóa (Appraisal Phase) kéo dài khoảng 300 ms đầu tiên để bộ não quét toàn cảnh, xác định bản chất sự kiện và phân vai ngữ nghĩa; tiếp theo là Giai đoạn Diễn đạt (Formulation Phase) khi mắt cố định lần lượt vào từng nhân tố ngay trước khi gọi tên họ.

Nghiên cứu / Tác giảTác vụ Thực nghiệmBiến số Thao tácChỉ số Eye Tracking ChínhKết luận Cơ chế Nhận thức
Meyer, Sleiderink & Levelt (1998)Gọi tên cặp đối tượng (Simple NP)Độ nét hình ảnh & Tần suất từViewing time giảm 15 ms (độ nét) và 34 ms (tần suất)Chuyển động mắt phụ thuộc vào sự hoàn thành của cả phân tích thị giác lẫn truy xuất hình thái từ vựng.
Meyer & van der Meulen (2000)Gọi tên cặp đối tượng + Từ nhiễu thính giácTừ nhiễu đồng âm (phonologically related) vs Không liên quanViewing time giảm 50 ms khi có mồi ngữ âmMắt chỉ rời khỏi vật thể khi dạng ngữ âm (phonological form) của từ đã được tạo lập hoàn chỉnh.
Meyer (2000)Cụm danh từ đơn giản vs Phức hợp"de bal" vs "de kleine groene bal"Viewing time tăng > 100% trong cụm từ phức hợpLập kế hoạch câu diễn ra cuộn sóng (incremental); mắt duy trì trên vật thể cho đến trước từ cuối cùng của cụm.
van der Meulen, Meyer & Levelt (2001)Nhắc lại đối tượng liên tiếp (Repeated Reference)Dùng Danh từ ("The angel") vs Đại từ ("It")Tỷ lệ bỏ qua điểm dừng (skipping rate) tăng cao ở nhóm đại từNếu thông tin khái niệm có sẵn trong bộ nhớ ngắn hạn, lệnh chuyển đổi mắt có thể bị hủy (cancelled).
Griffin & Bock (2000); Dobel et al.Mô tả bức tranh hành động/sự kiện phức tạpThực hiện tác vụ mô tả sự kiện vs Phát hiện mục tiêuPhân định Giai đoạn Đánh giá (300 ms đầu) và Giai đoạn Diễn đạtSản xuất câu trải qua khái niệm hóa toàn cảnh trước khi tiến hành truy xuất từ vựng theo chuỗi.

Phân tích chuyên sâu và những góc nhìn phê bình về cơ chế ánh mắt - lời nói

Các dữ liệu thu được từ kỹ thuật eye tracking đã củng cố mạnh mẽ cho Giả thuyết Nối tiếp (Serial Hypothesis) ở cấp độ điều khiển vận động nhãn cầu và truy xuất từ vựng. Mặc dù bộ não có khả năng xử lý sơ bộ các thông tin thị giác - khái niệm ở vùng ngoại fovea (extrafoveal region) trước khi mắt thực sự nhảy đến vật thể — như được chứng minh qua các thí nghiệm thay đổi kích thích phụ thuộc điểm nhìn (gaze-contingent display change) — quá trình truy xuất tên gọi (lexical retrieval) hầu như không diễn ra song song ở vùng ngoại fovea. Nói cách khác, việc kích hoạt tên gọi của một vật thể đòi hỏi ánh mắt phải cố định trực tiếp vào vật thể đó.

"Sự phối hợp giữa ánh mắt và lời nói không phải là một hiện tượng ngẫu nhiên hay thụ động, mà là một cơ chế điều khiển nhận thức vô cùng tinh vi. Ánh mắt đóng vai trò như một 'chiếc van điều tiết' (gating mechanism), bảo đảm rằng thông tin ngữ âm của từ hiện tại đã được chuẩn bị đầy đủ trước khi bộ não chuyển năng lượng chú ý sang lập kế hoạch cho từ tiếp theo."

Tuy nhiên, các bác sĩ lâm sàng và nhà nghiên cứu nhận thức cần lưu ý một số cạm bẫy phương pháp luận (pitfalls) khi phiên giải dữ liệu eye tracking trong sản xuất ngôn ngữ:

  • Sự bỏ qua điểm dừng (Eye movement skipping): Ánh mắt không phải lúc nào cũng dừng lại ở mọi vật thể được nhắc đến. Khi một đối tượng đã được đề cập trước đó và biểu trưng khái niệm của nó vẫn còn lưu giữ trong bộ nhớ làm việc (working memory), hoặc khi cấu trúc cú pháp sử dụng rất đơn giản (như đại từ "nó"), bộ não có thể hủy bỏ lệnh vận động nhãn cầu (saccadic cancellation). Do đó, sự thiếu vắng một điểm dừng mắt không đồng nghĩa với việc đối tượng đó bị bỏ qua trong lời nói.
  • Tác động của nhiệm vụ thực nghiệm (Task-driven vs. Stimulus-driven): Chuyển động mắt trong 300 ms đầu tiên của một cảnh quan phản ảnh quá trình hiểu cảnh trí (appraisal phase). Nhìn vào một vùng không phải luôn là để gọi tên vùng đó, mà có thể là để trích xuất hành động/động từ điều khiển toàn bộ cấu trúc câu.

Thông điệp ứng dụng trong nghiên cứu tâm lý ngôn ngữ và thần kinh nhãn khoa

  • Cơ sở đánh giá chức năng nhận thức - ngôn ngữ: Mối tương quan thời gian chặt chẽ giữa thời gian nhìn (viewing time) và năng lực truy xuất ngữ âm mở ra khả năng ứng dụng eye tracking như một công cụ thăm dò phi xâm lấn, nhạy bén để đánh giá các rối loạn xử lý ngôn ngữ, mất ngôn ngữ (aphasia) hoặc sa sút trí tuệ ở giai đoạn sớm.
  • Phân định các giai đoạn tổn thương thần kinh: Thông qua việc phân tích điểm dừng mắt trong Giai đoạn Đánh giá (Appraisal Phase) và Giai đoạn Diễn đạt (Formulation Phase), nhà lâm sàng có thể phân biệt tổn thương nằm ở khả năng khái niệm hóa cảnh trí hay ở bộ máy truy xuất từ vựng và mã hóa cú pháp.
  • Tối ưu hóa thiết kế nghiên cứu thị giác hai mắt và vận động nhãn cầu: Cần tính đến yếu tố độ phức tạp của ngôn ngữ đầu ra khi đánh giá chuyển động mắt. Một sự kéo dài điểm dừng mắt không thuần túy là khiếm khuyết vận động nhãn cầu hay xử lý thị giác, mà có thể do sự chậm trễ trong việc lập kế hoạch ngữ âm hoặc độ phức tạp cú pháp của cụm từ.
  • Nguyên lý lập kế hoạch cuộn sóng (Incremental Processing): Trong thực hành lâm sàng và giảng dạy, cần hiểu rằng người nói không lập kế hoạch toàn bộ một câu phức trước khi cất lời. Bộ não chỉ chuẩn bị phần đầu của cụm từ và tận dụng khoảng thời gian phát âm để liên tục quét và lập kế hoạch cho các thành tố tiếp theo.

Tài liệu tham khảo:

Meyer, A. S., & Dobel, C. (2003). Application of Eye Tracking in Speech Production Research. In J. Hyönä, D. P. Munoz, W. Heide, & R. Radach (Eds.), The Mind's Eye: Cognitive and Applied Aspects of Eye Movement Research (pp. 253–272). Elsevier Science BV. https://doi.org/10.1016/B978-044451020-5/50014-0

Xem thêm