(Quảng cáo)

top ad mobile advertisement
news1d ago

Các nhà nghiên cứu đã giải mã lý do ẩn giấu của các mô hình từ Anthropic, OpenAI và Google

Một bài báo từ MATS, ELLIS Tübingen, Max Planck và Snyk đã phát hiện ra rằng các khối lập luận được mã hóa từ API Anthropic, OpenAI và Google có thể được phát lại trong các phiên, làm lộ 62 khóa API trực tiếp, 33 mật khẩu và hàng trăm thông tin xác thực khác từ nhật ký của tác nhân công.

Các nhà nghiên cứu đã giải mã lý do ẩn giấu của các mô hình từ Anthropic, OpenAI và Google

(Quảng cáo)

native ad1 mobile advertisement

Một lỗ hổng trong cách các nhà cung cấp AI xử lý lý luận được mã hóa

Một bài báo được gửi vào ngày 10 tháng 8 bởi các nhà nghiên cứu tại MATS Research, Viện ELLIS Tübingen, Viện Hệ thống Thông minh Max Planck và Snyk đã vạch trần một lỗ hổng kiến ​​trúc quan trọng trong cách @AnthropicAI, @OpenAI@Google bảo vệ lý luận nội bộ của các mô hình ngôn ngữ lớn hàng đầu của họ.

Các mô hình suy luận hiện đại, bao gồm Claude Opus, GPT-5.6 và Gemini 3, tạo ra các dấu vết chuỗi suy nghĩ ẩn trước khi trả về phản hồi cho người dùng. Nhà cung cấp mã hóa các dấu vết này và trả lại chúng cho máy khách dưới dạng khối mờ, thay vì lưu trữ chúng ở phía máy chủ. Các nhà nghiên cứu nhận thấy rằng các khối được mã hóa đó hoàn toàn có thể di động: một khối được tạo trong một phiên có thể được phát lại trong một phiên khác, một tài khoản người dùng khác hoặc thậm chí là một mô hình khác trong cùng một dòng nhà cung cấp.

Cuộc tấn công được mô tả trong bài báoĐánh cắp dấu vết lý luận từ API LLM độc quyền, chỉ yêu cầu quyền truy cập API tiêu chuẩn, không có đặc quyền. Bằng cách cung cấp dấu vết được mã hóa từ một mô hình biên giới mạnh mẽ vào một mô hình anh chị em yếu hơn, ít được bảo vệ chặt chẽ hơn từ cùng một nhà cung cấp, mô hình yếu hơn có thể được nhắc in nguyên văn lý do ẩn, bằng văn bản thuần túy mà không cần tấn công trực tiếp vào mô hình mạnh hơn.

Hàng trăm thông tin xác thực được tìm thấy trong nhật ký đại lý công cộng

Nhóm cũng đã quét 6.708 bộ dữ liệu quỹ đạo tác nhân có sẵn công khai từ GitHub và Hugging Face, giải mã 315.320 khối lý luận được nhúng. Trên các khối đó, họ đã khôi phục được 704 cấu phần phần mềm riêng biệt về quyền riêng tư, bao gồm 62 khóa API trực tiếp, 33 mật khẩu và 24 mã thông báo truy cập. Đáng chú ý, 64 trong số những tạo phẩm đó chỉ xuất hiện bên trong lý luận được mã hóa và không bao giờ xuất hiện trong đầu ra cuộc trò chuyện hiển thị, có nghĩa là các nhà phát triển đã xuất bản những nhật ký đó không có cách nào biết được sự hiện diện của dữ liệu nhạy cảm.

Bài viết xác định bốn con đường lạm dụng cụ thể: đánh cắp lý do độc quyền để chắt lọc mô hình, trích xuất dữ liệu riêng tư từ dấu vết đã xuất bản của người dùng khác, khôi phục nội dung có hại mà câu trả lời trực quan của mô hình đã từ chối hiển thị và che giấu việc tiêm nhắc bên trong các khối lý luận được mã hóa để đầu độc việc triển khai tác nhân công cộng.

@AnthropicAI, @OpenAI@Google mỗi bên đã gửi các bản sửa lỗi phía máy chủ sau khi tiết lộ có trách nhiệm. Tuy nhiên, các nhà nghiên cứu lưu ý rằng các kết quả được trình bày trong bài báo không còn có thể tái tạo được do những biện pháp giảm thiểu đó, nhưng các bản ghi tác nhân đã được lấy từ kho lưu trữ công cộng vẫn có thể đọc được. Không có tuyên bố công khai nào từ bất kỳ nhà cung cấp nào trong số ba nhà cung cấp chính thức thừa nhận lỗ hổng hoặc gắn tài liệu cập nhật của họ với nghiên cứu này.

Nguồn:
Đánh cắp dấu vết lý luận từ API LLM độc quyền (arXiv)
Tin tức về hacker: Lỗ hổng OpenAI, Anthropic, Google API cho phép các mô hình AI yếu hơn giải mã lý luận của các mô hình mạnh hơn
Tin tức về an ninh mạng: Lỗ hổng API OpenAI, Anthropic và Google LLM làm lộ dấu vết lý luận ẩn giấu

Latest News

Read More...

Author

Crypto Rich profile photoCrypto Rich

Rich has been researching cryptocurrency and blockchain technology for eight years and has served as a senior analyst at BSCN since its founding in 2020. He focuses on fundamental analysis of early-stage crypto projects and tokens and has published in-depth research reports on over 200 emerging protocols. Rich also writes about broader technology and scientific trends and maintains active involvement in the crypto community through X/Twitter Spaces, and leading industry events.

Tham gia bản tin của chúng tôi

Đăng ký để nhận những hướng dẫn hay nhất và tin tức mới nhất về Web3.

Đăng ký tại đây!
BSCN

BSCN

Nguồn cấp dữ liệu RSS BSCN

BSCN là điểm đến của bạn cho tất cả mọi thứ về tiền điện tử và blockchain. Khám phá tin tức, phân tích thị trường và nghiên cứu mới nhất về tiền điện tử về Bitcoin, Ethereum, altcoin, memecoin và mọi thứ ở giữa.

Các nhà nghiên cứu đã giải mã lý do ẩn giấu của các mô hình từ Anthropic, OpenAI và Google | BSCN Breaking News