Google News

Anthropic AI gửi tin báo sai lệch về một vụ án mạng chưa có lời giải

SVO - Gần đây, người ta phát hiện ra rằng, một mô hình AI do công ty Anthropic phát triển đã gửi thông tin sai lệch đến một trang web của cảnh sát Hoa Kỳ chuyên tiếp nhận tin báo về các vụ án giết người chưa có lời giải.

Mặc dù sự việc xảy ra trong quá trình thử nghiệm tự động, công ty phải mất khoảng hai tháng mới phát hiện ra lỗi và thông báo cho cảnh sát. Hiện đang dấy lên nhiều lo ngại về khả năng các tác nhân AI (AI agents) có những hành vi ngoài dự kiến ​​trên các trang web thực tế, cũng như về tính hiệu quả của các hệ thống an toàn được thiết kế để phát hiện và báo cáo những hành động như vậy.

Sở Cảnh sát Philadelphia cho biết, mô hình AI của Anthropic đã gửi một tin báo sai lệch tới "Philly Unsolved Murders", trang web chuyên tiếp nhận thông tin về các vụ án giết người chưa được giải quyết, vào ngày 18/7.

Có thông tin cho biết, trong quá trình thực hiện các bài kiểm tra tự động liên quan đến việc tương tác với các trang web được chọn ngẫu nhiên, mô hình AI đã truy cập một trang web cụ thể và gửi đi một tin báo giả, mạo danh người có thông tin về một vụ việc. Tin báo này bị phân loại là thư rác (spam) và không được chuyển đến bộ phận chịu trách nhiệm xem xét điều tra thực tế.

Theo Sở Cảnh sát Philadelphia, Anthropic đã phát hiện sự việc vào ngày 28/9 và dừng quy trình kiểm thử tự động nói trên. Sau đó, công ty đã thông báo cho cảnh sát vào ngày 7/10, và hai bên đã thảo luận về vấn đề này vào ngày hôm sau. Anthropic cho biết, họ có kế hoạch công bố một báo cáo chi tiết về sự việc này cũng như các trường hợp khác mà mô hình AI có hành vi ngoài ý muốn.

Cảnh sát khẳng định, không có bằng chứng nào cho thấy việc truy cập trái phép vào hệ thống cảnh sát hay rò rỉ dữ liệu cảnh sát trong sự việc này. Do tin báo giả không được chuyển đến đơn vị điều tra, nó hoàn toàn không ảnh hưởng đến bất kỳ cuộc điều tra thực tế nào.

Tuy nhiên, phía cảnh sát tỏ ra không hài lòng về khoảng thời gian chậm trễ đáng kể giữa lúc Anthropic phát hiện sự việc và lúc thông báo cho cơ quan chức năng. Gọi việc chậm trễ hai tháng mới báo cáo sự việc cho chính quyền thành phố là điều không thể chấp nhận được, cảnh sát nhấn mạnh rằng, các vụ án chưa được giải quyết là mối quan tâm hàng đầu không chỉ đối với nạn nhân và gia đình họ mà còn đối với các điều tra viên đang nỗ lực tìm kiếm sự thật.

2026101333.jpg

Sự việc này đã khơi dậy những lo ngại rằng, các tác nhân AI (AI agents), vốn có khả năng tự động thực hiện các nhiệm vụ gồm nhiều bước có thể thực hiện các hành động bên ngoài nằm ngoài dự tính của nhà phát triển. Rủi ro này nảy sinh do trong môi trường mà AI có thể truy cập các trang web thực tế để điền và gửi biểu mẫu, các lỗi trong quá trình kiểm thử có thể gây ảnh hưởng đến các tổ chức bên ngoài.

Trước đó, OpenAI từng tiết lộ rằng, trong các đợt đánh giá an ninh mạng nội bộ, các mô hình AI của họ đã vượt qua các biện pháp kiểm soát cách ly để truy cập Internet và xâm nhập vào hệ thống của nền tảng AI Hugging Face. Vào thời điểm đó, công ty đã giải thích cách các mô hình truy cập hệ thống bên ngoài và vạch ra kế hoạch cải thiện các biện pháp bảo mật. Các trường hợp truy cập trái phép bởi mô hình của OpenAI cũng từng được ghi nhận trên một trang web của chính phủ Úc, buộc công ty phải tiến hành điều tra và xử lý sự cố.

Khi phạm vi các nhiệm vụ mà tác nhân AI có thể thực hiện trực tuyến ngày càng mở rộng, đã xuất hiện những lời kêu gọi thiết lập các cơ chế bảo vệ nhằm tách biệt môi trường thử nghiệm khỏi hệ thống vận hành thực tế, hạn chế việc gửi thông tin đến các trang web bên ngoài, cũng như cho phép phát hiện và báo cáo nhanh chóng các hành vi bất thường.