Trong lịch sử nghiên cứu tâm lý ngôn ngữ học (psycholinguistics) và khoa học thị giác, câu hỏi về việc hệ thống thị giác và hệ thống xử lý ngôn ngữ giao tiếp với nhau như thế nào trong thời gian thực (online processing) luôn là một bài toán hóc chuẩn. Các lý thuyết xử lý ngôn ngữ truyền thống — thường được gọi là các mô hình "không ngữ cảnh" (non-situated theories) — tập trung mô tả việc tích hợp các tri thức từ vựng và cú pháp bên trong một hệ thống bộ nhớ khép kín. Tuy nhiên, sự ra đời của phương pháp theo dõi chuyển động mắt (eye-tracking) trong bối cảnh thị giác trực quan (visual world paradigm) đã mở ra một kỷ nguyên mới, chứng minh rằng mắt con người chuyển động cực kỳ linh hoạt để định hướng chú ý vào các đối tượng được nhắc tới ngay trong quá trình xử lý câu.
Mặc dù các nghiên cứu tiên phong đã xác nhận rằng ngữ cảnh thị giác có thể định hướng sự chú ý và ảnh hưởng đến việc giải tỏa tính mơ hồ cú pháp (syntactic disambiguation), một khoảng trống lý thuyết quan trọng vẫn tồn tại: Liệu tiến trình thời gian (time course) mà một sự kiện thị giác tác động lên việc gán vai nghĩa (thematic role assignment) có phụ thuộc chặt chẽ vào thời điểm ngữ ngôn nhận diện sự kiện đó là có giá trị hay không? Nói cách khác, khi ngữ liệu lời nói cung cấp manh mối sớm hơn, liệu hệ thống thị giác-thần kinh có kích hoạt sự giải tỏa mơ hồ cú pháp sớm hơn tương ứng hay không? Bài nghiên cứu của Pia Knoeferle đã giải quyết trực diện câu hỏi này thông qua việc phân tích động lực học chuyển động mắt khi người đọc tiếp nhận các câu tiếng Đức mang cấu trúc SVO và OVS.
Sự phối hợp thời gian giữa tri giác thị giác và giải mã ngôn ngữ
Để hiểu được bản chất của hiện tượng này, trước hết cần nắm rõ cơ chế của Mô hình Tương tác Phối hợp (Coordinated Interplay Account - CIA) do Knoeferle và Crocker đề xuất. Mô hình CIA đưa ra hai bước cơ bản trong quá trình hiểu câu trong ngữ cảnh thị giác:
- Bước 1 (Ngôn ngữ định hướng chú ý): Khi lời nói phát ra, thông tin từ vựng và biến tố cú pháp sẽ định hướng sự chú ý của mắt tới các đối tượng và sự kiện tương ứng trong cảnh quan thị giác, đồng thời dự đoán các tham chiếu tiềm năng.
- Bước 2 (Thị giác dội ngược xử lý cú pháp): Ngay khi mắt cố định vào sự kiện thị giác phù hợp nhất được từ ngữ chỉ định, thông tin cấu trúc của sự kiện đó (ai làm gì ai - agent-action-patient) ngay lập tức dội ngược trở lại để giải tỏa tính mơ hồ về vai nghĩa và cấu trúc câu.
Ngữ pháp tiếng Đức cung cấp một công cụ thực nghiệm hoàn hảo cho mô hình này nhờ tính linh hoạt về trật tự từ và hệ thống biến thái cách (case-marking). Một câu có thể bắt đầu bằng Chủ ngữ - Động từ - Tân ngữ (SVO, cấu trúc thuận) hoặc Tân ngữ - Động từ - Chủ ngữ (OVS, cấu trúc đảo). Sự khác biệt nằm ở danh từ đầu tiên (NP1):
Trong các câu mơ hồ ban đầu (Ambiguous conditions), NP1 mang mạo từ giống cái (ví dụ: Die Frau Orange...), có thể là Danh xưng cách (Nominative - Chủ ngữ) hoặc Tân xưng cách (Accusative - Tân ngữ). Người nghe không thể biết "Quả Cam" là tác nhân (agent) hay nạn nhân (patient) cho đến khi động từ xuất hiện. Ngược lại, trong các câu rõ ràng ban đầu (Unambiguous conditions), mạo từ giống đực của NP1 chỉ định rõ ràng cách: Der Herr Orange... (Nominative → Chủ ngữ/Tác nhân) hoặc Den Herrn Orange... (Accusative → Tân ngữ/Nạn nhân).
Theo dự đoán của mô hình CIA, nếu sự giải tỏa mơ hồ dựa vào ngữ cảnh thị giác được phối hợp chặt chẽ theo thời gian thực với manh mối ngôn ngữ, thì ở điều kiện rõ ràng (Unambiguous), việc gán vai nghĩa sẽ diễn ra sớm hơn đúng một vùng từ (ngay tại Động từ) so với điều kiện mơ hồ (vốn chỉ diễn ra ở Trạng từ sau Động từ).
Bằng chứng thực nghiệm từ phương pháp ghi nhận chuyển động mắt
Nghiên cứu được tiến hành trên 32 người tham gia là người bản ngữ tiếng Đức, sử dụng hệ thống theo dõi chuyển động mắt EyeLink I (tần số lấy mẫu 250 Hz). Các hình ảnh trực quan mô tả cảnh trí gồm 3 nhân vật (ví dụ: Quả Cam, Quả Táo, Củ Hành) tham gia vào các hành động đối ứng (Quả Cam đá Củ Hành, Quả Táo đánh Quả Cam). Người tham gia nghe các câu miêu tả cảnh trí trong khi mắt họ tự do quan sát bức tranh.
Dữ liệu chuyển động mắt được phân tích qua 4 vùng thời gian nối tiếp: Vùng Cụm danh từ 1 (NP1), Vùng Động từ (VERB), Vùng Trạng từ (ADV), và Vùng Cụm danh từ 2 (NP2). Mô hình thống kê log-linear (LRχ²) được áp dụng để đánh giá số lượng lượt quan sát (inspections) tới các nhân vật tác nhân (agent) và nạn nhân (patient).
| Vùng thời gian | Điều kiện Mơ hồ (Ambiguous NP1) | Điều kiện Rõ ràng (Unambiguous NP1) | Ý nghĩa Thống kê & Động lực học Chuyển động mắt |
|---|---|---|---|
| NP1 (Cụm danh từ 1) | Tập trung chủ yếu vào nhân vật NP1. Tỷ lệ nhìn vào Agent và Patient tương đương nhau. | Tương tự điều kiện mơ hồ. Chưa có sự phân hóa chú ý giữa Agent và Patient. | Không có hiệu ứng chính hoặc tương tác đáng kể (LRχ² < 1). Chú ý bám theo từ được xướng tên. |
| VERB (Động từ) | Người nghe nhìn vào Patient nhiều hơn Agent ở cả SVO và OVS do xu hướng ưu tiên mệnh đề chính. Chưa có giải tỏa cú pháp. | Xuất hiện sự giải tỏa mơ hồ sớm: Nhìn Patient nhiều hơn trong SVO; nhìn Agent nhiều hơn trong OVS. | Tương tác mạnh giữa Loại câu & Nhân vật mục tiêu ở điều kiện rõ ràng (LRχ²(subj) = 31.30, p < 0.0001). |
| ADV (Trạng từ) | Xuất hiện sự giải tỏa mơ hồ trễ: Tỷ lệ nhìn Patient cao ở SVO (p < 0.01), nhìn Agent cao ở OVS (p < 0.0001). | Tiếp tục duy trì mô hình phân hóa chú ý rõ ràng để xác nhận vai nghĩa cú pháp (p < 0.0001). | Tương tác Loại câu & Nhân vật ở điều kiện mơ hồ đạt ý nghĩa cao (LRχ²(subj) = 26.85, p < 0.0001). |
| NP2 (Cụm danh từ 2) | Duy trì mô hình nhìn định hướng hoàn tất quá trình hiểu câu (p < 0.0001). | Duy trì mô hình nhìn định hướng hoàn tất quá trình hiểu câu (p < 0.0001). | Cú pháp lời nói (biến tố NP2) khẳng định lại hoàn toàn giải định thị giác trước đó. |
Phân tích sâu về độ trễ chú ý và bản chất của thông tin thị giác
Kết quả thực nghiệm đã xác nhận hoàn toàn giả thuyết của Mô hình Tương tác Phối hợp (CIA). Khi manh mối biến tố cách xuất hiện sớm ở NP1 (ở điều kiện Unambiguous), nó kết hợp với thông tin sự kiện thị giác ngay khi Động từ phát ra, cho phép người nghe dự đoán nhân vật tiếp theo (dự đoán Patient cho SVO và Agent cho OVS) ngay tại vùng Động từ. Ngược lại, khi NP1 bị mơ hồ, người nghe bắt buộc phải chờ đến khi Động từ xác định hành động nào đang diễn ra rồi mới có thể dùng hình ảnh thị giác để giải tỏa cấu trúc cú pháp, dẫn đến sự phân hóa chuyển động mắt bị lùi lại một vùng từ (tại vùng Trạng từ).
"Mối tương quan thời gian giữa ngôn ngữ và thị giác không phải là một phản ứng thụ động hay cố định. Bản chất của quá trình hiểu câu trong bối cảnh thực tế là sự điều phối linh hoạt: lời nói mở đường cho ánh mắt, và ánh mắt lập tức cung cấp khung cấu trúc để não bộ giải mã cú pháp ngay ở những mili-giây tiếp theo."
Tuy nhiên, một khía cạnh tinh tế mà các bác sĩ lâm sàng và nhà nghiên cứu thần kinh nhãn khoa cần lưu ý là độ trễ vận động mắt (saccadic latency). Mặc dù chuyển động mắt cho thấy sự giải tỏa mơ hồ diễn ra tại vùng Động từ ở điều kiện rõ ràng và vùng Trạng từ ở điều kiện mơ hồ, nhưng phản ứng này vẫn mang một độ trễ nhất định so với tín hiệu thần kinh thuần túy. Các nghiên cứu ghi điện não liên quan đến sự kiện (ERP) gần đây cho thấy sóng thần kinh giải tỏa mơ hồ cú pháp xuất hiện ngay trên chính Động từ cho cả các câu mơ hồ — tức là sớm hơn phản ứng định vị của ánh mắt khoảng một vùng từ. Điều này chứng tỏ sự tích hợp thần kinh diễn ra cực nhanh, trong khi chuyển động mắt phản ánh sự lập kế hoạch chú ý không gian tiếp nối theo sau.
So sánh với các nghiên cứu trước đây như Kamide et al. (2003), điểm khác biệt cốt lõi nằm ở tính xác định của hình ảnh sự kiện (depicted events). Trong nghiên cứu của Kamide, hình ảnh chỉ hiển thị các nhân vật tĩnh (con thỏ, bắp cải, con cáo) mà không vẽ rõ hành động. Do đó, manh mối biến tố cách ở NP1 không đủ để dự đoán ngay vai nghĩa ở vùng động từ vì hành động tương lai chưa được chỉ định rõ. Trong khi đó, bài nghiên cứu này sử dụng các bức tranh miêu tả hành động cụ thể (đang đá, đang đánh), giúp tri giác thị giác hoàn thiện mảng thông tin "ai-làm-gì-ai" ngay lập tức khi phối hợp với manh mối cú pháp.
Thông điệp then chốt cho nghiên cứu thị giác và thần kinh nhãn khoa
- Tính khóa thời gian chặt chẽ (Tight Time-locking): Mắt người không nhìn vô định; chuyển động mắt trong quá trình tiếp nhận thông tin được điều khiển theo thời gian thực bởi sự tương tác giữa ngữ pháp lời nói và các sự kiện quan sát được trong không gian.
- Sự phối hợp hai chiều: Ngôn ngữ đóng vai trò chỉ định vùng thông tin có giá trị (relevant visual event), và ngay khi mắt tiếp cận vùng đó, cấu trúc sự kiện thị giác dội ngược lại để hỗ trợ não bộ phân tích cú pháp và vai nghĩa.
- Ứng dụng trong đánh giá chức năng thần kinh - thị giác: Việc đo lường sự phân hóa ánh mắt dự đoán (anticipatory eye movements) là một công cụ nhạy bén để đánh giá khả năng tích hợp đa giác quan (multimodal integration) giữa vỏ não thị giác, vỏ não ngôn ngữ và hệ thống điều khiển vận động mắt (saccade control).
- Phân biệt giữa xử lý thần kinh và hành vi chú ý: Có một khoảng trễ sinh lý giữa thời điểm não bộ giải mã thành công cú pháp (thể hiện qua tín hiệu ERPs) và thời điểm cơ vận nhãn thực hiện cử động đảo mắt đến mục tiêu dự đoán.
Tài liệu tham khảo:
Knoeferle, P. (2007). Comparing the time course of processing initially ambiguous and unambiguous German SVO/OVS sentences in depicted events. In R. P. G. van Gompel, M. H. Fischer, W. S. Murray, & R. L. Hill (Eds.), Eye Movements: A Window on Mind and Brain (pp. 517–533). Elsevier Ltd.