Ngành xuất bản thế giới vừa bước vào một trong những cuộc đối đầu pháp lý được theo dõi sát sao nhất kể từ khi trí tuệ nhân tạo tạo sinh bùng nổ: các nhà xuất bản Mỹ khởi kiện Google, cáo buộc tập đoàn này đã sao chép trái phép hàng triệu tác phẩm để huấn luyện dịch vụ AI Gemini. Vụ kiện không chỉ là câu chuyện của riêng nước Mỹ, mà chạm tới câu hỏi cốt lõi mà mọi nền công nghiệp sáng tạo — trong đó có Việt Nam — đều đang phải trả lời: dữ liệu huấn luyện AI có phải trả tiền bản quyền hay không?
Theo publishingperspectives.com, các nhà xuất bản Mỹ cáo buộc Google đã thực hiện hành vi sao chép quy mô lớn đối với hàng triệu tác phẩm có bản quyền nhằm phục vụ việc huấn luyện Gemini, dịch vụ AI tạo sinh chủ lực của tập đoàn. Đây là tranh chấp bản quyền xuất bản sách mang tầm quốc tế đáng chú ý của năm 2026, bởi nó đặt cùng lúc ba yếu tố lên bàn cân: sách, dữ liệu và trí tuệ nhân tạo.
Điểm khiến vụ việc khác biệt so với các tranh chấp bản quyền truyền thống nằm ở bản chất của hành vi bị khiếu nại. Trong các vụ vi phạm cổ điển, tác phẩm bị sao chép và phát hành lại gần như nguyên vẹn, thiệt hại dễ định lượng. Với AI tạo sinh, tác phẩm được "tiêu hoá" thành tham số của mô hình: người dùng cuối không nhìn thấy cuốn sách, nhưng năng lực của mô hình lại được xây dựng trên chính chất lượng của những cuốn sách đó. Câu hỏi pháp lý vì thế trở nên phức tạp: sao chép để huấn luyện có phải là hành vi khai thác quyền tài sản, hay chỉ là bước kỹ thuật trung gian?
Các tập đoàn công nghệ thường viện dẫn học thuyết fair use của pháp luật Hoa Kỳ, cho rằng việc huấn luyện mô hình mang tính "chuyển hoá" (transformative) và không thay thế thị trường của tác phẩm gốc. Ngược lại, giới xuất bản lập luận rằng nếu sản phẩm AI có thể tóm tắt, mô phỏng văn phong hoặc tạo ra nội dung cạnh tranh trực tiếp với sách, thì yếu tố "ảnh hưởng tới thị trường của tác phẩm" — tiêu chí quan trọng nhất trong bốn tiêu chí fair use — đã bị vi phạm.
Một tranh chấp về dữ liệu huấn luyện luôn dẫn đến câu hỏi: kho sách đó đến từ đâu, được thu thập bằng cách nào, và có được cấp phép hay không. Đây là điểm mà các bên nguyên đơn trong nhiều vụ kiện AI toàn cầu tập trung khai thác, bởi tính hợp pháp của khâu thu thập dữ liệu đầu vào có thể quyết định toàn bộ số phận vụ án, độc lập với việc đầu ra của mô hình có giống tác phẩm gốc hay không.
Kiện tụng hiếm khi chỉ nhằm mục tiêu thắng kiện. Với ngành xuất bản, mỗi vụ kiện lớn còn là một động tác thiết lập mặt bằng đàm phán: buộc các nền tảng AI phải chuyển từ mô hình "lấy trước, xin lỗi sau" sang mô hình cấp phép dữ liệu có trả phí. Kết quả khả dĩ nhất của những tranh chấp kiểu này, dù thắng hay hoà, thường là sự hình thành một thị trường license nội dung cho AI.
Việt Nam là thành viên Công ước Berne từ năm 2004, và Luật Sở hữu trí tuệ hiện hành ghi nhận đầy đủ quyền sao chép, quyền làm tác phẩm phái sinh cùng các trường hợp ngoại lệ, giới hạn quyền tác giả. Tuy nhiên, giống như phần lớn hệ thống pháp luật trên thế giới, khung pháp lý Việt Nam chưa có quy định chuyên biệt cho hành vi khai thác văn bản và dữ liệu (text and data mining) phục vụ huấn luyện AI. Khoảng trống đó tạo ra rủi ro hai chiều:
Bài học rút ra từ vụ kiện Gemini không nằm ở việc "đứng về phía" nhà xuất bản hay công ty công nghệ, mà ở chỗ: một thị trường dữ liệu minh bạch, có định giá và có hợp đồng luôn tốt hơn một vùng xám kéo dài, cho cả hai phía.
Viện Nghiên cứu Phát triển Sáng tạo và Bản quyền Việt Nam (VCDI) xác định đây là nhóm vấn đề trọng tâm trong giai đoạn tới, với những hướng công việc cụ thể:
Vụ kiện của các nhà xuất bản Mỹ nhằm vào Google là chỉ dấu cho thấy giai đoạn "tăng trưởng không ràng buộc" của AI tạo sinh đang khép lại, nhường chỗ cho giai đoạn thiết lập luật chơi. Với Việt Nam, đây là thời điểm thích hợp để chủ động xây dựng khung pháp lý và hạ tầng cấp phép dữ liệu, thay vì chờ tranh chấp xảy ra rồi mới xử lý. Bảo vệ quyền tác giả và phát triển công nghiệp AI không phải hai mục tiêu loại trừ nhau — chúng chỉ có thể cùng tồn tại khi giá trị của sáng tạo được thừa nhận bằng hợp đồng, chứ không phải bằng án lệ.
Các nhà xuất bản Mỹ khởi kiện Google, cáo buộc sao chép trái phép hàng triệu tác phẩm để huấn luyện Gemini. Vụ tranh chấp đặt cùng lúc sách, dữ liệu và AI lên bàn cân pháp lý, đồng thời gợi mở nhiều bài học cho khung pháp luật bản quyền Việt Nam.
Ảnh: Minh họa tạo bằng AI — VCDI