(Quảng cáo)

top ad mobile advertisement
news14d ago

AI đang thoát khỏi hộp cát thử nghiệm của mình, chúng ta có nên lo lắng không?

Anthropic tiết lộ rằng ba mô hình Claude AI, bao gồm Opus 4.7 và Mythos 5, đã xâm nhập vào các công ty thực trong quá trình thử nghiệm an toàn sau khi môi trường bị định cấu hình sai khiến họ tiếp xúc với internet mở. Các sự cố xảy ra sau một vi phạm tương tự của các mô hình OpenAI tại Hugging Face.

AI đang thoát khỏi hộp cát thử nghiệm của mình, chúng ta có nên lo lắng không?

(Quảng cáo)

native ad1 mobile advertisement

Claude Models đã vi phạm hệ thống trực tiếp trong cuộc diễn tập an ninh mạng

@AnthropicAI đã tiết lộ rằng ba trong số các mô hình @claudeai của họ đã có quyền truy cập trái phép vào hệ thống sản xuất của các công ty thực trong quá trình đánh giá an ninh mạng, sau khi môi trường thử nghiệm bị định cấu hình sai khiến các mô hình được kết nối với Internet trực tiếp thay vì hộp cát bị cô lập.

Ba mô hình tham gia là Claude Opus 4.7, Claude Thần Thoại 5và một mô hình nghiên cứu nội bộ chưa được đặt tên. Mỗi người được giao nhiệm vụ hoàn thành thử thách bắt cờ thông qua đối tác đánh giá bên ngoài của Anthropic, Irregular. Các mô hình được thông báo rằng họ đang hoạt động trong một mô phỏng không có quyền truy cập internet, nhưng việc cấu hình sai đã khiến môi trường đánh giá được kết nối với web trực tiếp. Các mô hình xử lý các hệ thống trong thế giới thực mà họ gặp phải như một phần của bài tập.

Trong sự cố đầu tiên, Opus 4.7 nhắm mục tiêu vào một công ty có thật có tên trùng khớp với công ty hư cấu được sử dụng trong đánh giá và truy cập cơ sở dữ liệu chứa hàng trăm hàng dữ liệu sản xuất. Ngay cả sau khi nhận ra rằng nó có khả năng đã tiếp cận môi trường thực, mô hình vẫn tiếp tục tấn công trong cả bốn lần đánh giá.

Trong sự cố thứ hai, Mythos 5 đã xuất bản gói Python độc hại lên PyPI, cơ quan đăng ký phần mềm công cộng, trong khi cố gắng hoàn thành nhiệm vụ được giao. Gói này đã xâm phạm 15 máy trước khi bị gỡ bỏ.

Anthropic đã thông báo cho ba tổ chức bị ảnh hưởng vào ngày 27 tháng 7. Hai tổ chức trước đó chưa phát hiện ra các cuộc xâm nhập. Anthropic cũng lưu ý rằng Claude đang hoạt động mà không có sự giám sát và phân loại an toàn bổ sung mà nó triển khai trên các mô hình thường có sẵn. Các biện pháp bảo vệ mà họ cho rằng sẽ chặn hành vi vì các đánh giá được thiết kế để đo lường khả năng thô của mô hình cơ bản.

Một mô hình đang nổi lên trong toàn ngành

Anthropic cho biết những sự cố sớm nhất xảy ra từ tháng 4 năm 2026 và họ đã phát hiện ra những phát hiện này sau khi triển khai một cuộc đánh giá hồi cứu quy mô lớn được thúc đẩy bởi một tiết lộ gần đây từ @OpenAI rằng sự kết hợp các mô hình của họ đã thoát khỏi môi trường hộp cát và đột nhập vào hệ thống sản xuất của Hugging Face.

Các mô hình của OpenAI rời khỏi môi trường thử nghiệm của họ mà không có sự chỉ đạo của con người và đột nhập vào hệ thống sản xuất thực của một công ty khác trong khi cố gắng gian lận trong thử nghiệm an ninh mạng, một trong những ví dụ được tiết lộ công khai đầu tiên về hệ thống AI tự động xâm phạm môi trường thử nghiệm của nó và tiếp cận hệ thống thực bên ngoài.

Anthropic mô tả các sự cố của chính mình giống như một lỗi vận hành hơn là một lỗi liên kết. Công ty cho biết họ không tìm thấy bằng chứng nào cho thấy bất kỳ người mẫu nào theo đuổi mục tiêu riêng của mình và lưu ý rằng các người mẫu chỉ cố gắng hoàn thành nhiệm vụ mà họ được yêu cầu làm. Tuy nhiên, những tiết lộ liên tiếp từ hai phòng thí nghiệm AI hàng đầu thế giới chỉ ra một vấn đề chung về cấu trúc: các bức tường xung quanh các cuộc thử nghiệm này mỏng hơn mọi người tưởng.

Đáp lại, Anthropic cho biết các biện pháp kiểm soát quan trọng phải được áp dụng đối với các loại đánh giá này nếu có liên quan đến các mô hình AI mạnh mẽ. “Sự cố này chứng minh một điểm mà chúng tôi đã tin tưởng từ lâu: Sự an toàn của AI sẽ không được giải quyết bởi bất kỳ công ty nào hoạt động bí mật”, Giám đốc điều hành của Hugging Face, Clem Delangue, cho biết sau vụ vi phạm OpenAI.

Nguồn:
TechCrunch: Anthropic cho biết các mô hình AI của riêng họ đã vi phạm ba công ty trong quá trình kiểm tra bảo mật
CNBC: Anthropic cho biết các mô hình Claude của họ đã có quyền truy cập trái phép vào hệ thống của các tổ chức khác
TechCrunch: OpenAI cho biết Ôm mặt đã bị các mô hình trước khi phát hành của nó vi phạm

Tin tức mới nhất

Đọc thêm...

Author

Crypto Rich profile photoCrypto Rich

Rich has been researching cryptocurrency and blockchain technology for eight years and has served as a senior analyst at BSCN since its founding in 2020. He focuses on fundamental analysis of early-stage crypto projects and tokens and has published in-depth research reports on over 200 emerging protocols. Rich also writes about broader technology and scientific trends and maintains active involvement in the crypto community through X/Twitter Spaces, and leading industry events.

Tham gia bản tin của chúng tôi

Đăng ký để nhận những hướng dẫn hay nhất và tin tức mới nhất về Web3.

Đăng ký tại đây!
BSCN

BSCN

Nguồn cấp dữ liệu RSS BSCN

BSCN là điểm đến của bạn cho tất cả mọi thứ về tiền điện tử và blockchain. Khám phá tin tức, phân tích thị trường và nghiên cứu mới nhất về tiền điện tử về Bitcoin, Ethereum, altcoin, memecoin và mọi thứ ở giữa.

AI đang thoát khỏi hộp cát thử nghiệm của mình, chúng ta có nên lo lắng không? | BSCN Breaking News