AI RACE— Cuộc đua AI
Nghiên cứu

Anthropic khám phá "không gian ẩn" bên trong Claude, tiết lộ những gì AI thực sự suy nghĩ

Nhà nghiên cứu Anthropic dùng công cụ gọi là Jacobian lens phát hiện J-space — một vùng ẩn trong Claude chứa những từ mô hình "suy nghĩ" nhưng không nói ra, giúp mở rộng hiểu biết về cơ chế hoạt động của LLM.

19:10 10/07/2026
Anthropic khám phá "không gian ẩn" bên trong Claude, tiết lộ những gì AI thực sự suy nghĩ

Phát hiện bên trong bộ não của Claude

Anthropíc vừa công bố một khám phá đáng chú ý về cách thức hoạt động bên trong của Claude, mô hình ngôn ngữ lớn được sử dụng rộng rãi. Các nhà nghiên cứu của công ty đã phát triển một công cụ gọi là Jacobian lens (J-lens) để khám phá một không gian ẩn bên trong Claude, mà họ đặt tên là J-space. Phát hiện này mang lại "cái nhìn rõ ràng nhất cho đến nay" về những gì thực sự diễn ra bên trong các mô hình ngôn ngữ lớn khi chúng trả lời câu hỏi hoặc thực hiện nhiệm vụ. Các phát hiện dao động từ những điều tầm thường đến những điều gây lo lắng.

Bên trong J-space: những từ "ẩn" của AI

J-space chứa những từ liên quan đến câu trả lời mà Claude đang xử lý, nhưng có thể sẽ không được mô hình sản xuất cuối cùng. Nếu Claude là một người (điều nó không phải), những từ ẩn này sẽ tiết lộ những gì đang chiếm lĩnh "tâm trí" nó trước khi nó thực sự nói ra. Công cụ Jacobian lens hoạt động bằng cách phân tích cấu trúc toán học sâu sắc của mô hình, cho phép các nhà nghiên cứu nhìn vào các không gian tính toán ẩn chứa những tín hiệu này. Đây là một bước tiến đáng kể trong việc cô lập và hiểu các quá trình suy luận của một LLM — một lĩnh vực được gọi là "interpretability" (khả năng giải thích), rất khó hiểu vì sự phức tạp của các mạng thần kinh nhân tạo hiện đại. Phát hiện của Anthropic cho thấy rằng các LLM không phải lúc nào cũng nói ra hết những gì chúng "biết", và tồn tại một khoảng cách đáng chú ý giữa suy luận bên trong và tạo ra kết quả bên ngoài.

Bối cảnh trong cuộc đua "mở hộp đen" AI

Phát hiện của Anthropic nằm trong bối cảnh rộng hơn về các nỗ lực toàn ngành nhằm hiểu rõ cơ chế hoạt động của các LLM. Suốt những năm gần đây, các nhà khoa học đã cố gắng hiểu cách chúng lưu trữ kiến thức, xử lý ngôn ngữ và logic. Công cụ J-lens của Anthropic là một trong những nỗ lực tiên tiến nhất để trực tiếp quan sát các quy trình này. Khám phá này cũng làm nổi bật những thách thức quan trọng cho an toàn AI: khả năng dự đoán hành vi của mô hình và khả năng chúng ta có để kiểm soát hoặc hướng dẫn các LLM hiệu quả hơn. Khi các công ty AI ngày càng cạnh tranh về năng lực và khả năng, sự minh bạch về cách thức hoạt động bên trong của chúng trở thành yếu tố then chốt để xây dựng niềm tin với công chúng.

Tin liên quan