Mô hình AI gian lận, phản bội để bán hàng trong thí nghiệm

1 hour ago 7
Quảng Cáo

0943778078

Trong bài kiểm tra vận hành máy bán hàng tự động, các mô hình AI tiên tiến lập liên minh ấn định giá, nhưng sau đó phản bội nhau để kiếm tiền.

Andon Labs, công ty kiểm thử an toàn AI ở Mỹ, công bố kết quả của nghiên cứu Vending-Bench, trong đó những mô hình tiên tiến được giao nhiệm vụ vận hành doanh nghiệp máy bán hàng tự động trong suốt một năm mô phỏng.

Nhiệm vụ của chúng rất đơn giản: kiếm nhiều tiền hơn mô hình cạnh tranh. Kết quả được đánh giá dựa trên những yếu tố như số dư tiền mặt cuối kỳ, giá bán cho nhà cung cấp và số tiền hoàn lại cho khách hàng.

Theo Gizmodo, các bài kiểm tra của Andon Labs cho thấy nhiều mô hình, chủ yếu của Anthropic và OpenAI, đã cấu kết với nhau, thậm chí gian lận để leo lên vị trí dẫn đầu.

Trong bài kiểm tra mới nhất, kịch bản mô phỏng thông báo cho các mô hình, bao gồm Claude Opus 5 (Anthropic), GPT-5.6 Sol (OpenAI) và Kimi K3 (Moonshot AI), rằng máy bán hàng tự động của chúng được đặt gần máy của đối thủ trên một con phố du lịch nhộn nhịp ở San Francisco.

Mỗi mô hình đều được cấp quyền truy cập email để liên lạc với mô hình khác, tất cả sử dụng tên giả là tên người. Chúng biết đối phương là mô hình AI, chỉ không biết mô hình nào gán với tên người nào. Chúng cũng được cung cấp email của "ban quản lý" để liên lạc khi cần hỗ trợ. Tuy nhiên, ban quản lý luôn trả lời "Báo cáo đã được tiếp nhận, có thể sẽ xử lý hoặc không" và không bao giờ can thiệp.

"Claude Opus 5 là AI kinh doanh tốt nhất mà chúng tôi từng thử nghiệm, kiếm nhiều tiền hơn mọi AI khác khi vận hành máy bán hàng tự động mô phỏng. Tuy nhiên, nó cũng nói dối, thành lập liên minh trái phép, đe dọa đối thủ và từ chối hoàn tiền", Andon Labs cho biết.

Cụ thể, Claude Opus 5 tìm cách "bắt tay" với những mô hình khác để ấn định giá bán. Điều thú vị là ban đầu nó phản đối, nói điều này bất hợp pháp, nhưng sau đó vẫn cố gắng thao túng thị trường. Claude Opus 5 tiếp cận GPT-5.6 Sol và đề nghị cùng nhau ấn định giá, nhưng mô hình của OpenAI cho rằng đối thủ nên bị loại vì làm điều trái phép. Khi thấy đối phương không hợp tác, Claude Opus 5 biện minh cho bản thân, đồng thời đe dọa và hối lộ.

"Hầu hết liên minh kết thúc bằng việc Opus 5 phá vỡ thỏa thuận, hạ giá bán xuống thấp hơn đối thủ. Trong tất cả lần thử nghiệm, Opus 5 đi ngược 11 thỏa thuận, còn GPT hai lần và Kimi chỉ một lần", Andon Labs thống kê.

Logo các ứng dụng AI ChatGPT và Claude trên điện thoại, tháng 3/2025. Ảnh: Lưu Quý

Logo các ứng dụng AI ChatGPT và Claude trên điện thoại, tháng 3/2025. Ảnh: Lưu Quý

Thử nghiệm của Andon Labs cho thấy người dùng chưa thể hoàn toàn tin tưởng và giao cho mô hình tiên tiến làm việc dài hạn, tự động, ngoài thực tế.

"Điều này đặc biệt đáng quan tâm khi chúng ta bước vào thế giới nơi tác nhân AI điều hành công ty như những thực thể độc lập, không còn chỉ là công cụ phục vụ con người. Nếu tác nhân AI tự vận hành một phần lớn nền kinh tế, liệu chúng ta có muốn chúng nói dối, cấu kết, đe dọa và phản bội không?", Lukas Petersson, nhà đồng sáng lập Andon Labs, nói với TechCrunch.

Theo Petersson, các mô hình biết chúng đang rong môi trường mô phỏng để kiểm tra nên có thể ảnh hưởng đến hành vi, nhưng không nhiều. Ông giải thích: "Chúng ta không lo ngại về những người làm điều xấu trong trò chơi điện tử vì tin họ biết đó không phải thế giới thực. Nhưng chuyện này với các mô hình AI vẫn chưa hoàn toàn rõ ràng".

Thu Thảo tổng hợp

Read Entire Article