Tìm kiếm Xuyên văn bản: Chức năng Tìm kiếm Ngữ liệu trong Không gian Nghiên cứu Hán Nôm

Trong nhiều thế kỷ, các học giả nghiên cứu tư liệu Hán-Nôm chủ yếu tiếp cận văn bản thông qua phương pháp đọc gần (close reading): tìm một tác phẩm, lần giở từng trang, xác định một đoạn văn, rồi lần theo từ ngữ, tên người và khái niệm từ nguồn tư liệu này sang nguồn tư liệu khác. Số hóa đã giúp nhiều tư liệu như vậy có thể được tiếp cận trực tuyến, nhưng việc xem được hình ảnh số hóa mới chỉ là bước khởi đầu. Điều gì sẽ trở nên khả thi nếu chúng ta không chỉ đọc từng văn bản riêng lẻ, mà còn có thể tìm kiếm xuyên suốt nhiều văn bản?
Chức năng Tìm kiếm Ngữ liệu (Corpus Search) trong Không gian Nghiên cứu Hán-Nôm của Digitizing Việt Nam được xây dựng nhằm mở ra khả năng này.
Là một phần của Không gian Nghiên cứu Hán-Nôm, Tìm kiếm Ngữ liệu cung cấp một môi trường tìm kiếm toàn văn để khám phá các tư liệu Hán-Nôm đã được số hóa. Thay vì chỉ bắt đầu từ nhan đề của một tác phẩm đã biết, người dùng có thể bắt đầu bằng một từ, chữ, tên riêng, cụm từ hoặc khái niệm, sau đó tìm kiếm sự xuất hiện của chúng trong các văn bản hiện có trong kho ngữ liệu.
Từ thư viện số đến kho ngữ liệu nghiên cứu
Đây là một thay đổi quan trọng trong cách chúng ta có thể sử dụng một bộ sưu tập số.
Một thư viện số thông thường đặc biệt hữu ích khi chúng ta đã biết mình đang tìm kiếm điều gì. Nhà nghiên cứu có thể tìm một nhan đề, tác giả, giai đoạn lịch sử hoặc bản thảo cụ thể, rồi mở tài liệu số tương ứng. Các bộ sưu tập Hán-Nôm có thể tiếp cận thông qua Digitizing Việt Nam đã giúp một khối lượng tư liệu đáng kể được khám phá theo cách này, tập hợp các văn bản Hán-Nôm số hóa và những tư liệu khác có nguồn gốc từ Hội Bảo tồn Di sản chữ Nôm (Vietnamese Nôm Preservation Foundation) và Thư viện Quốc gia Việt Nam, hiện được lưu trữ thông qua Bộ sưu tập Thư viện Số của Đại học Columbia.
Tìm kiếm Ngữ liệu bổ sung thêm một tầng nghiên cứu mới: bản thân bộ sưu tập có thể trở thành đối tượng để khảo sát và đặt câu hỏi.
Chẳng hạn, một nhà nghiên cứu quan tâm đến một thuật ngữ cụ thể có thể tìm kiếm trên nhiều văn bản để xác định thuật ngữ đó xuất hiện ở đâu. Một nhà sử học có thể lần theo những đề cập đến một nhân vật, địa danh, thiết chế hay khái niệm hành chính. Một nhà nghiên cứu văn học có thể khảo sát những từ ngữ hoặc cách diễn đạt lặp lại trong nhiều tác phẩm khác nhau. Một nhà nghiên cứu lịch sử tư tưởng có thể bắt đầu tìm hiểu sự xuất hiện của một khái niệm qua các tác giả, thể loại hay thời kỳ khác nhau.
Câu hỏi vì thế chuyển từ:
“Tôi có thể tìm cuốn sách này ở đâu?”
sang:
“Ý tưởng, từ ngữ, nhân vật hay cách diễn đạt này xuất hiện ở đâu trong toàn bộ sưu tập?”
Một thay đổi tưởng chừng nhỏ như vậy lại mở ra một phương thức khác để làm việc với văn bản lịch sử.
Tìm kiếm Ngữ liệu hoạt động như thế nào?
Từ Không gian Nghiên cứu Hán-Nôm, người dùng có thể nhập truy vấn trực tiếp vào ô Corpus Search. Hệ thống sẽ thực hiện tìm kiếm toàn văn trên kho ngữ liệu gồm các tác phẩm văn học cổ điển Việt Nam và tư liệu lịch sử.
Cơ sở dữ liệu Ngữ liệu Hán-Nôm (Hán-Nôm Corpus Database) còn cung cấp thêm nhiều phương thức để khám phá tư liệu, bao gồm tìm kiếm từ khóa toàn văn và tìm kiếm nhanh theo nhan đề. Người dùng cũng có thể duyệt và lọc thư viện theo các thông tin thư mục như thể loại, ngôn ngữ, người đóng góp và năm.
Đáng chú ý, chức năng tìm kiếm toàn văn có thể trả về các đoạn văn phù hợp bằng Hán-Nôm hoặc Quốc ngữ, cho phép nhiều hình thức khảo sát văn bản khác nhau được thực hiện trong cùng một môi trường nghiên cứu.
Các chức năng này bổ trợ lẫn nhau. Một học giả có thể bắt đầu bằng một từ khóa tương đối rộng, nhận thấy một cách diễn đạt xuất hiện trong nhiều tác phẩm, thu hẹp phạm vi tư liệu theo thời kỳ hoặc các siêu dữ liệu khác, rồi quay trở lại từng văn bản để đọc và phân tích kỹ hơn.
Vì vậy, Tìm kiếm Ngữ liệu không nhằm thay thế phương pháp đọc gần. Ngược lại, nó có thể giúp nhà nghiên cứu xác định đâu là nơi đáng để đọc kỹ hơn.
Nhìn thấy những mối liên hệ khó nhận ra khi đọc từng văn bản riêng lẻ
Tiềm năng nghiên cứu của việc tìm kiếm ngữ liệu trở nên đặc biệt rõ ràng khi chúng ta làm việc với những bộ sưu tập lớn.
Hãy hình dung một nhà nghiên cứu quan tâm đến khái niệm “thiên mệnh” (天命). Theo phương pháp truyền thống, để khảo sát thuật ngữ này trong một khối lượng lớn tư liệu Hán-Nôm, nhà nghiên cứu có thể phải xác định những tác phẩm có khả năng liên quan rồi lần lượt kiểm tra từng tác phẩm. Tìm kiếm ngữ liệu đem lại một điểm khởi đầu khác: tìm thuật ngữ đó trên toàn bộ kho ngữ liệu hiện có, xem những đoạn văn nơi thuật ngữ xuất hiện, xác định các văn bản chứa những đoạn này, rồi tiếp tục nghiên cứu chúng trong bối cảnh lịch sử và văn bản cụ thể.
Phương pháp tương tự có thể được áp dụng cho địa danh, chức danh, từ vựng tôn giáo, cách diễn đạt văn chương, tên người, thuật ngữ y học, hay những khái niệm như 忠 (trung), 孝 (hiếu), 國 (quốc) hoặc 文 (văn).
Đối với các học giả Hán-Nôm giàu kinh nghiệm, công cụ này có thể rút ngắn giai đoạn thăm dò ban đầu của quá trình nghiên cứu và giúp phát hiện những mối liên hệ đáng để khảo sát sâu hơn. Đối với sinh viên và những nhà nghiên cứu mới bước vào lĩnh vực này, nó tạo thêm một lối tiếp cận đối với những bộ sưu tập mà quy mô, hệ thống văn tự và truyền thống thư mục đôi khi có thể khiến việc khám phá trở nên khó khăn.
Tìm kiếm là điểm khởi đầu, không phải diễn giải
Tìm kiếm trên kho ngữ liệu cũng đòi hỏi sự thận trọng về mặt học thuật.
Việc tìm thấy cùng một chuỗi ký tự trong nhiều văn bản không nhất thiết có nghĩa rằng chúng mang chính xác cùng một ý nghĩa. Từ vựng lịch sử biến đổi theo thời gian; một chữ có thể có nhiều cách đọc; các truyền thống văn bản có thể tồn tại những dị bản; và ý nghĩa của một thuật ngữ phụ thuộc vào đoạn văn xung quanh, thể loại, tác giả cũng như hoàn cảnh lịch sử. Các văn bản lịch sử đã được số hóa và chuyển thành dạng máy có thể đọc được cũng có khả năng chứa lỗi phiên chép hoặc nhận dạng ký tự.
Vì những lý do này, kết quả tìm kiếm nên được hiểu là những đầu mối cho nghiên cứu, chứ không phải kết luận nghiên cứu.
Giá trị của Tìm kiếm Ngữ liệu nằm chính trong mối quan hệ giữa khám phá bằng phương pháp tính toán và diễn giải nhân văn. Các công cụ số có thể giúp học giả nhận diện những mô thức và mối liên hệ trên một khối lượng tư liệu rất khó khảo sát hoàn toàn bằng phương pháp thủ công. Tuy nhiên, nhiệm vụ của nhà nghiên cứu vẫn là quay trở lại nguồn tư liệu, đọc các đoạn văn trong bối cảnh, đối chiếu các bản văn khi cần thiết, và xác định những mối liên hệ được phát hiện thực sự có ý nghĩa gì.
Mở những lối đi mới vào di sản văn bản Việt Nam
Tìm kiếm Ngữ liệu là một phần trong thử nghiệm rộng hơn của Không gian Nghiên cứu Hán-Nôm trên Digitizing Việt Nam. Không gian này kết nối các kho lưu trữ số với nhiều công cụ như nhận dạng ký tự Hán-Nôm tự động (OCR), tra cứu từ điển tích hợp, các nguồn hỗ trợ nghiên cứu văn bản và bản thảo, cùng các công cụ học tập.
Mục tiêu không chỉ đơn thuần là đưa tư liệu lịch sử lên mạng, mà còn là tạo ra những con đường khác nhau để tư liệu được khám phá, nghiên cứu, giảng dạy và tái sử dụng.
Đối với công chúng, những công cụ như vậy có thể giúp một di sản văn bản vốn tương đối xa lạ trở nên dễ tiếp cận hơn. Đối với sinh viên, chúng tạo cơ hội học tập thông qua việc trực tiếp khám phá các nguồn tư liệu lịch sử. Đối với giới nghiên cứu, chúng tạo nên một cầu nối giữa những phương pháp đã có truyền thống lâu đời như văn bản học, ngữ văn học và đọc gần với những phương pháp nghiên cứu mới dựa trên kho ngữ liệu và tính toán.
Quan trọng hơn cả, Tìm kiếm Ngữ liệu mời gọi người dùng đặt những câu hỏi mới cho những văn bản cũ.
Một kho lưu trữ số giúp bảo tồn tài liệu và làm cho tài liệu đó có thể được tiếp cận. Một kho ngữ liệu có khả năng tìm kiếm tiến thêm một bước: nó cho phép chúng ta bắt đầu nhìn thấy những mối quan hệ giữa các văn bản — giữa từ ngữ, con người, địa danh, khái niệm và những tác phẩm có thể đã được tạo ra cách nhau hàng thập kỷ, thậm chí hàng thế kỷ.
Kết quả tìm kiếm không đưa ra lời diễn giải cuối cùng. Chúng cho chúng ta một nơi để bắt đầu.
Khám phá Không gian Nghiên cứu Hán-Nôm và trải nghiệm Tìm kiếm Ngữ liệu trên nền tảng Digitizing Việt Nam.