thethaovanhoa.vn

Google chịu sức ép về cách thu thập dữ liệu phục vụ AI

Hương Thủy/TTXVN 10/08/2026 16:39 GMT+7

Giới quan sát cảnh báo việc Google sử dụng hạ tầng tìm kiếm để phục vụ đồng thời cho các sản phẩm trí tuệ nhân tạo (AI) đang tạo ra lợi thế cạnh tranh vượt trội cho "ông lớn" này, song cũng làm dấy lên lo ngại về tương lai của hệ sinh thái nội dung trên Internet.

Giới quan sát cảnh báo việc Google sử dụng hạ tầng tìm kiếm để phục vụ đồng thời cho các sản phẩm trí tuệ nhân tạo (AI) đang tạo ra lợi thế cạnh tranh vượt trội cho "ông lớn" này, song cũng làm dấy lên lo ngại về tương lai của hệ sinh thái nội dung trên Internet.

Vị thế thống trị của Google trong lĩnh vực tìm kiếm được xây dựng trên một thỏa thuận ngầm với các chủ sở hữu trang web: công cụ thu thập dữ liệu tự động của hãng được phép quét và lập chỉ mục nội dung, đổi lại Google dẫn người đọc quay trở lại các trang này. Tuy nhiên, ranh giới giữa dữ liệu phục vụ tìm kiếm và dữ liệu dùng cho AI ngày càng mờ nhạt, khi cùng một công cụ hiện phục vụ cả công cụ tìm kiếm lẫn mô hình AI chủ lực Gemini của hãng.

Google chịu sức ép về cách thu thập dữ liệu phục vụ AI - Ảnh 1.

Trụ sở của Google tại California, Mỹ. Ảnh: Kyodo/TTXVN

Ông Matthew Prince, Giám đốc điều hành công ty an ninh mạng Cloudflare, cho biết phạm vi quét dữ liệu của Google rộng gấp 3,2 lần so với công cụ của OpenAI và gấp 4,8 lần so với của Microsoft. Vị quản lý cho rằng cách làm này đẩy các đơn vị xuất bản nội dung vào thế khó: nếu chặn dữ liệu phục vụ huấn luyện AI, họ đồng thời đánh mất nguồn truy cập từ tìm kiếm mà mình phụ thuộc.

Giới chuyên gia đã cảnh báo nếu AI ngày càng đọc, tóm tắt và viết lại nội dung mà không dẫn người đọc trở lại trang gốc, động lực kinh tế để tạo ra thông tin nguyên bản sẽ dần mai một.

Số liệu của Cloudflare cho thấy tính từ đầu năm 2026, các tác nhân AI tạo ra hơn 57% lưu lượng truy cập Internet, cao hơn so với khoảng 42% đến từ con người. Đây cũng là lần đầu tiên hoạt động của máy móc vượt con người trên không gian mạng. Xu hướng này được dự báo còn rõ nét hơn khi trợ lý AI mở rộng tới người dùng phổ thông. Mới đây, Meta thông báo sẽ sớm ra mắt phiên bản trợ lý AI dành cho người dùng đại chúng trên các nền tảng Facebook Messenger, WhatsAppInstagram.

Theo các tài liệu nội bộ được công bố trong một vụ kiện chống độc quyền tại Mỹ, Google từng cân nhắc cho phép các trang web từ chối cung cấp dữ liệu cho AI mà vẫn hiện diện trong kết quả tìm kiếm hồi tháng 4/2024, ngay trước khi ra mắt tính năng tóm tắt bằng AI. Phương án này cuối cùng không được triển khai, với lý do lĩnh vực này đang trở thành một không gian thương mại hóa cho Google.

Sức ép đòi hỏi Google thay đổi hiện gia tăng từ nhiều phía. Từ phía doanh nghiệp, Cloudflare tuyên bố từ ngày 15/9 sẽ mặc định chặn các công cụ thu thập dữ liệu đa mục đích đối với nhóm khách hàng có nguồn thu từ quảng cáo. Điều này đồng nghĩa Google có thể mất quyền truy cập hàng triệu trang web.

Tương tự, hồi tháng 6, Cơ quan Cạnh tranh và Thị trường Anh (CMA) đã yêu cầu Google trao cho chủ sở hữu trang web quyền lựa chọn rõ ràng trong việc chặn nội dung bị sử dụng cho sản phẩm AI mà vẫn giữ nguyên thứ hạng tìm kiếm. Đại diện Google xác nhận hãng đang thử nghiệm một tùy chọn cho phép các trang web không tham gia phần trả lời bằng AI mà không ảnh hưởng tới thứ hạng tìm kiếm. Công ty cho hay sẽ triển khai tùy chọn này trên phạm vi toàn cầu sau khi hoàn tất thử nghiệm tại Anh.

Dù vậy, hai chức năng thu thập dữ liệu vẫn chưa được tách rời về mặt kỹ thuật, đồng nghĩa các trang web tiếp tục phải đặt niềm tin vào cam kết của Google. Với thị phần tìm kiếm khoảng 90%, mọi điều chỉnh trong chính sách dữ liệu của "đại gia" công nghệ này đều có thể định hình lại mô hình kinh tế của ngành nội dung số trong những năm tới.

Bản quyền © Báo điện tử Thể thao & Văn hóa - TTXVN