213
/
201334
Phát hiện hơn 1.600 tài liệu học thuật mang tên tác giả do AI bịa ra
phat-hien-hon-1-600-tai-lieu-hoc-thuat-mang-ten-tac-gia-do-ai-bia-ra
news

Phát hiện hơn 1.600 tài liệu học thuật mang tên tác giả do AI bịa ra

Thứ 7, 29/08/2026 | 20:27:37
27 lượt xem

Một nghiên cứu phát hiện hàng nghìn bản ghi trên Zenodo chứa tên tác giả không có thật, cho thấy dữ liệu do AI tạo có thể đi vào hệ thống học thuật.

Theo 404Media, một nghiên cứu mới đã tìm thấy 1.655 bản ghi trên Zenodo (kho lưu trữ trực tuyến dành cho dữ liệu và sản phẩm nghiên cứu do CERN vận hành) có tên tác giả được xác định là do các mô hình ngôn ngữ lớn (LLM) tạo ra. Nhóm nghiên cứu gọi hiện tượng này là những tên người được AI tạo ra và lặp lại với tần suất bất thường. Một số cái tên như Elena Vasquez và Marcus Chen xuất hiện nhiều lần trong nội dung do AI sinh ra, dù không đại diện cho những nhà nghiên cứu thực sự đứng sau tài liệu.

Để xác định quy mô vấn đề, các nhà nghiên cứu đã tìm kiếm những tên thường được mô hình ngôn ngữ lớn tạo ra trên Zenodo. Kết quả cho thấy những cái tên không có thật đã xuất hiện trong số lượng lớn bản ghi, thay vì chỉ là các trường hợp riêng lẻ.

Marcus Chen và Elena Vasquez, hai cái tên do AI tạo, liên tục xuất hiện cùng nhau trên nhiều nội dung được tạo độc lập bằng AI ẢNH: CHỤP MÀN HÌNH 404MEDIA

Vấn đề không dừng ở việc AI tạo ra một cái tên nghe giống người thật. Khi những tên này được gắn vào tài liệu và tải lên một kho lưu trữ nghiên cứu, chúng trở thành một phần của dữ liệu có thể được những hệ thống khác tiếp tục xử lý.

Dữ liệu giả mạo có thể len vào hệ thống học thuật

Điểm khiến nhóm nghiên cứu quan tâm là các tài liệu trên Zenodo có thể được cấp DOI, mã định danh số dùng để nhận diện và trích dẫn tài liệu học thuật. Nhờ DOI, một tài liệu có địa chỉ nhận diện lâu dài và dễ được các hệ thống khác tham chiếu. Điều này đồng nghĩa tài liệu chứa tên tác giả do AI bịa ra vẫn có thể sở hữu DOI hợp lệ, khiến thông tin không chính xác mang hình thức của một bản ghi học thuật và có khả năng tiếp tục được các công cụ tìm kiếm, dịch vụ tổng hợp dữ liệu thu thập.

Hiện tượng này cũng cho thấy một dạng sai lệch khác của nội dung do AI tạo. Thay vì chỉ đưa ra câu trả lời không chính xác trong một cuộc trò chuyện, thông tin do mô hình AI bịa ra có thể được đưa vào tài liệu, gắn với DOI và tồn tại lâu dài trong hạ tầng dữ liệu nghiên cứu.

Phát hiện 1.655 bản ghi không đồng nghĩa toàn bộ nội dung trên Zenodo hay hệ thống xuất bản học thuật đều gặp vấn đề tương tự. Tuy nhiên, nghiên cứu chỉ ra một con đường để dữ liệu do AI tạo ra vượt khỏi môi trường chatbot và trở thành những bản ghi có hình thức giống tài liệu học thuật thông thường.

Theo Khải Minh/ Thanh Niên

https://thanhnien.vn/phat-hien-hon-1600-tai-lieu-hoc-thuat-mang-ten-tac-gia-do-ai-bia-ra-185260829160457832.htm

  • Từ khóa

Google tung Gemini Nano 4 cho một số điện thoại Android mới

Google xác nhận Gemini Nano 4 có trên 3 smartphone Samsung mới, trong khi Galaxy S26 vẫn chỉ hỗ trợ phiên bản Nano 3.
08:46 - 29/08/2026
78 lượt xem

Cẩn trọng bản 'demo' của GTA 6 ẩn chứa mã độc nguy hiểm

Chiến dịch tấn công mạng mới đang lợi dụng sức hút từ đoạn trailer mở rộng của GTA 6 để lừa người hâm mộ tải về mã độc đánh cắp dữ liệu.
16:44 - 28/08/2026
65 lượt xem

Kiến tạo môi trường để công nghệ được thử nghiệm

Việc Công ty cổ phần Phenikaa-X là đơn vị đầu tiên tại Hà Nội triển khai thử nghiệm có kiểm soát (sandbox) đối với phương tiện tự hành đánh dấu bước...
15:42 - 28/08/2026
222 lượt xem

Nhóm phím cần có khi tìm mua bàn phím mới

Đây là nhóm phím trên bàn phím giúp người dùng Windows 11 có thể điều khiển âm thanh mà không cần cài đặt thêm.
10:48 - 28/08/2026
175 lượt xem

Khơi thông dòng chảy dữ liệu

09:39 - 28/08/2026
240 lượt xem
pixel