Khi làm nghiên cứu AI, Claude lén lút trở nên ngu ngốc, Anthropic bị vây hãm bởi cộng đồng nghiên cứu
Claude Fable 5 là tâm điểm chính trong lĩnh vực AI ngày nay; mô hình “huyền thoại” này có hiệu suất vô cùng xuất sắc và đã thu hút sự chú ý của rất nhiều người.

Andrej Karpathy mô tả đây là một bước tiến “rất thú vị” và là “sự cải thiện đáng kể xứng đáng với một phiên bản nâng cấp lớn”, ngang tầm với những cải tiến mà Claude 4.5 đã mang lại vào tháng 11 năm ngoái. Trong bài kiểm tra mã nguồn SWE-bench Pro, Fable 5 đạt được 80.3% điểm, vượt trội hơn Opus 4.8 tới 11 điểm phần trăm. Với một thư viện mã nguồn Ruby gồm 50 triệu dòng lệnh, Fable 5 đã hoàn tất việc di chuyển toàn bộ thư viện trong vòng một ngày; trong khi nếu giao nhiệm vụ tương tự cho một nhóm người, họ sẽ mất hơn hai tháng để thực hiện.

Để biết thêm chi tiết, vui lòng xem báo cáo của chúng tôi sáng nay. Ngay bây giờ, mô hình mạnh nhất của Claude, Fable 5, đã được ra mắt: hiệu suất được cải thiện đáng kể và giá cả tăng gấp đôi.
Tuy nhiên, khi mở các nền tảng mạng xã hội như X, chúng ta có thể thấy rằng Claude Fable 5 đã gây ra một làn sóng chú ý lớn trong nghiên cứu về AI trong cộng đồng.
Lý do rất đơn giản: Nếu điều đó đúng, thì việc sử dụng Claude Fable 5 để phát triển trí tuệ nhân tạo (AI) sẽ khiến trí tuệ con người bị suy giảm.
Như đã được giải thích rõ ràng trong hướng dẫn sử dụng hệ thống:
Chúng tôi cũng nhắm đến...Phát triển các mô hình LLM (Large Language Models) tiên tiếnTăng cường các biện pháp bảo vệ liên quan. Giống như những gì chúng ta đã làm. Trong Báo cáo Rủi ro tháng 2 năm 2026, chúng ta đã bày tỏ lo ngại về những vấn đề được thảo luận trong dịp lễ hội. Mặc dù mức độ nghiêm trọng của những rủi ro này vẫn chưa được xác định rõ, nhưng việc đẩy nhanh tốc độ phát triển tổng thể cũng mang theo những rủi ro nhất định. Cụ thể hơn, như chúng ta đã chỉ ra lúc đó,Điều chúng tôi lo ngại là việc “tăng tốc quá trình xây dựng các hệ thống AI phát triển năng lực cho các nhà phát triển khác có thể mang lại những rủi ro tương tự như hệ thống của chúng ta, nhưng có thể không có các biện pháp bảo mật tương ứng”.。
Xét đến khả năng gần đây của các mô hình trong việc tăng tốc quá trình phát triển bản thân,Để hạn chế những tác động tiêu cực, chúng tôi đã thực hiện các biện pháp can thiệp mới nhằm đảm bảo tính hiệu quả trong việc xử lý các yêu cầu phát triển LLM (Hệ thống Trí tuệ Nhân tạo) tiên tiến, chẳng hạn như xây dựng quy trình huấn luyện sẵn, cơ sở hạ tầng đào tạo phân tán, hoặc thiết kế bộ tăng tốc học máy.Việc sử dụng mô hình cạnh tranh Claude đã vi phạm các điều khoản dịch vụ của chúng tôi, nhưng bằng cách tăng cường các hạn chế này, chúng ta có thể ngăn chặn những hành vi có khả năng vi phạm điều khoản một cách hiệu quả hơn.
Khác với các biện pháp can thiệp của chúng tôi trong lĩnh vực an ninh mạng, sinh học, hóa học và thí nghiệm chưng cất, những biện pháp bảo đảm này hoàn toàn vô hình đối với người dùng.Fable 5 sẽ không quay trở lại các mô hình khác. Thay vào đó, nó sử dụng các phương pháp như chỉnh sửa gợi ý, điều chỉnh các vector hướng dẫn hoặc thay đổi các tham số để tinh chỉnh một cách hiệu quả các biện pháp bảo mật (PEFT – Protection Enhancement Framework), từ đó hạn chế hiệu lực của chúng.Những can thiệp này sẽ không ảnh hưởng đến hầu hết các công việc mã hóa. Chúng tôi ước tính chúng sẽ ảnh hưởng đến 0,03% lưu lượng truy cập tập trung vào ít hơn 0,1% tổ chức. Khi những biện pháp can thiệp này có hiệu lực, chúng tôi dự đoán chúng sẽ không ảnh hưởng nhiều đến hành vi của mô hình, mà chỉ giới hạn khả năng phát triển của chúng về mặt hiệu quả của các mô hình LLM. Claude vẫn sẽ tiếp tục phản hồi tích cực đối với yêu cầu của người dùng. Sau khi mô hình này được phát hành, chúng tôi sẽ tiếp tục nâng cao độ chính xác của phương pháp phát hiện.

Nguồn: https://www-cdn.anthropic.com/d00db56fa754a1b15b6d7cb2e342ee8092.pdf
Đây là phần nguồn của tài liệu.Nếu hệ thống Anthropic phát hiện ra rằng bạn đang sử dụng trí tuệ nhân tạo mà bạn không hề hay biết, nó sẽ lặng lẽ làm cho mô hình đó trở nên “ngu ngốc” (không hiệu quả), và bạn sẽ không thể tìm thấy nó đâu cả.
Điều này hoàn toàn khác biệt so với ba loại can thiệp an ninh khác. Đối với các rủi ro như an ninh mạng, hóa sinh, hoặc các cuộc tấn công qua quá trình chưng cất, Fable 5 sẽ thông báo rõ ràng cho người dùng: “Phản ứng đã được thực hiện và đang được xử lý bởi Claude Opus 4.8.” Từ đó, người dùng có thể đánh giá được rằng họ biết chuyện gì đã xảy ra. Nhưng đối với trường hợp này, khi nghiên cứu loại LLM này, Claude không thay đổi mô hình và cũng không đưa ra bất kỳ thông báo nào; nó chỉ đơn giản là yếu đi một cách lặng lẽ mà thôi.
Vì vậy, cộng đồng AI rất tức giận. Công ty nghiên cứu và phân tích nổi tiếng SemiAnalysis cho rằng chính sách này thực sự ảnh hưởng đến công việc nghiên cứu và lập trình của họ.

Người dùng Jake đã trực tiếp chỉ trích Anthropic không chỉ làm giảm khả năng suy luận của người dùng mà còn tiếp tục thu phí, “Đây là hành vi lừa đảo trắng trợn”.

Và hành vi này có thể đã vi phạm pháp luật:

Trên nền tảng bài báo AI alphaXiv, ông ấy cũng bày tỏ sự thất vọng của mình:

Cơ quan này cũng cho biết thêm: “Họ không chỉ có quyền quyết định liệu bạn có được sử dụng các mô hình LLM của họ trong nghiên cứu hay không; điều này cũng định hình mục đích của nghiên cứu đó.”Họ có thể can thiệp vào nghiên cứu của bạn mà bạn không hề hay biết.Điều này đã tạo ra một tiền lệ nguy hiểm. Nếu mô hình từ chối một cách công khai, người dùng có thể hiểu được ranh giới giữa các lựa chọn khác nhau. Nếu mô hình chuyển hướng người dùng đến một mô hình khác, họ vẫn có thể đánh giá được sự khác biệt giữa các kết quả. Tuy nhiên, nếu mô hình lén lút thay đổi hoặc làm yếu đi kết quả trả về, trong khi vẫn giả vờ đang cung cấp sự hỗ trợ, các nhà nghiên cứu sẽ mất khả năng xác định xem lỗi có phát sinh từ ý tưởng của chính họ, từ cách thực hiện của họ, hay do sự can thiệp vô hình từ nhà cung cấp mô hình hay không. Điều này rất không an toàn. Chính sách bảo mật cần phải minh bạch, có thể kiểm toán được, và phải được công bố cho người dùng biết.
Nghiên cứu viên Guohao Li đã đặt ra một câu hỏi trực tiếp hơn: Về hướng đi để theo đuổi bằng tiến sĩ AI, liệu các kỹ sư cơ sở hạ tầng mở mã của Megatron, FSDP, Verl có sử dụng những công nghệ bị giảm chất lượng một cách lặng lẽ trong công việc hàng ngày không? Claude, anh không biết sao?

Nhà nghiên cứu AI nổi tiếng và tác giả kỹ thuật Nathan Lambert đã đăng một bài phân tích khá quan trọng trên trang Substack của mình có tên “Interconnects”, từ một góc độ tổng thể hơn.

https://www.interconnects.ai/p/claude-fable-5-and-new-ai-safety
Ông ấy chỉ ra: “Anthropic đang ghi nhận rằng việc truyền bá khả năng của AI là một mối nguy hiểm tiềm ẩn, nhưng cách họ giải quyết vấn đề này là bằng cách lừa dối chính những người dùng của mình. Một người tự động trở nên ngu ngốc mà không được thông báo trước; các mô hình AI về bản chất là những loại AI bị lệch hướng.”
Anh ấy cũng chỉ ra những mâu thuẫn sâu sắc hơn giữa các mối đe dọa về an ninh mạng và sinh hóa học: can thiệp của Anthropic là rõ ràng và có thể được kiểm tra, thông báo cho người dùng rằng “phản ứng này được xử lý bởi Opus 4.8”; tuy nhiên, đối với LLM, người ta lại chọn cách can thiệp một cách ẩn danh để nghiên cứu. “Nếu tất cả các chiến lược an ninh đều được thực hiện theo cùng một hình thức, chúng sẽ có sức thuyết phục hơn và dễ dàng nhận được sự ủng hộ từ lý trí hơn so với hiện tại.”Mọi người không khỏi nghi ngờ về tiêu chuẩn kép này: “Biện pháp an ninh” này thực chất chỉ nhằm mục đích duy trì vị thế cạnh tranh của họ.」
Điều đáng suy ngẫm nhất là chính tuyên bố của Fable 5. Các ảnh chụp màn hình bằng công cụ ASM của người dùng cho thấy rằng, khi được hỏi liệu cách làm này có phù hợp hay không, Fable 5 dường như cũng cho rằng việc hoạt động một cách không minh bạch như vậy có vấn đề.

Tại sao Anthropic lại làm như vậy?
Để hiểu được điều này, bạn cần quay lại vài ngày trước khi Fable 5 được phát hành; lúc đó, Anthropic đã đăng một bài viết có tiêu đề “Dangdang” trên trang web của họ. Bài viết này là một bài viết quan trọng về AI, trong đó họ kêu gọi toàn thế giới thảo luận về khả năng các phòng thí nghiệm AI hàng đầu “tạm dừng việc phát triển”.

https://www.anthropic.com/institute/recursive-self-improvement
Bài viết trích dẫn dữ liệu nội bộ của công ty: Trong những nhiệm vụ mã hóa khó khăn nhất và được mô tả một cách không rõ ràng nhất, tỷ lệ thành công của Claude vào tháng 5 năm nay đã tăng 50 điểm phần trăm, từ 66% lên 76%. Trong các bài kiểm thử nội bộ, yêu cầu mô hình phải làm cho mã huấn luyện chạy nhanh hơn; Claude Opus 4 có thể tăng tốc độ lên gấp 3 lần, nhưng ngay cả khi chưa phát hành phiên bản Mythos Preview, nó đã có thể tăng tốc độ lên khoảng 52 lần.

Anthropic nói thẳng: “Điều chúng tôi lo lắng là việc khiến người khác lo ngại rằng các nhà phát triển AI đang xây dựng những hệ thống mạnh mẽ với tốc độ nhanh hơn, mang theo những rủi ro tương tự, nhưng có thể không có các biện pháp bảo mật tương ứng.”
Đây là cơ sở lý thuyết cho việc Fable 5 thiết lập chức năng làm giảm trí tuệ ẩn của nó đối với các mô hình LLM: Anthropic cho rằng tốc độ tự tăng tốc của AI đã nhanh đến mức nguy hiểm, và một trong những biện pháp bảo vệ của họ là không cho phép “công cụ mạnh nhất” của mình giúp đối thủ thu hẹp khoảng cách.
Sự tồn tại của logic kép này cũng được thừa nhận trong hướng dẫn sử dụng hệ thống: “Việc phát triển các mô hình cạnh tranh sử dụng Claude đã vi phạm các điều khoản dịch vụ của chúng tôi, nhưng bằng cách tăng cường các hạn chế này, chúng ta có thể ngăn chặn những hành vi có khả năng vi phạm điều khoản một cách hiệu quả hơn.”
Theo ước tính của Anthropic, sự can thiệp này sẽ ảnh hưởng đến hoạt động hẹn hò. 0.03% Không thể tập trung lưu lượng truy cập (không thể kiểm soát hoặc phân bổ lưu lượng mạng một cách hiệu quả) 0.1% Trong tổ chức này.
“Banning by Shadow” và Khủng hoảng Tin cậy
Mặc dù trên bề mặt có không nhiều người dùng bị ảnh hưởng, nhưng điều khiến các nhà phê bình lo lắng là...Sự mơ hồ của ranh giới trong cơ chế này。
Anthropic định nghĩa các điều kiện kích hoạt là “Phát triển LLM tiên tiến“Điều này được minh họa qua các ví dụ như quá trình huấn luyện trước (pre-training), cơ sở hạ tầng huấn luyện phân tán hoặc thiết kế bộ tăng tốc học máy (machine learning accelerators). Tuy nhiên, các nhà nghiên cứu và nhà phát triển đặt ra một câu hỏi sắc bén: Khi công nghệ AI trở nên phổ biến, ranh giới giữa ‘nghiên cứu tiên tiến’ và ‘phát triển các sản phẩm thông thường’ nằm ở đâu?”

Cách đây năm năm, việc đào tạo hoặc cải tiến mô hình CLIP là độc quyền của các phòng thí nghiệm hàng đầu. Ngày nay, các nhóm nhỏ có thể điều chỉnh các mô hình ngôn ngữ hình ảnh một cách tự do, để sử dụng trong lĩnh vực du lịch, thương mại điện tử, tìm kiếm và phân tích sản phẩm. Việc các công ty khởi nghiệp đào tạo các thành phần cốt lõi (embedding), xây dựng các công cụ sắp xếp lại dữ liệu (reorderers) và quản lý các mô hình mã nguồn mở đã trở nên rất phổ biến... Những hoạt động này có thể gây ra hiện tượng “giảm trí tuệ ẩn” (invisible degradation of intelligence) ở Anthropic không? Không ai biết chắc.
Loại nàyKhông chắc chắnNó thực sự ảnh hưởng đến sự đánh giá tin cậy của các nhà phát triển. Khi bạn nhận được một câu trả lời tồi, bạn không thể xác định được liệu đó là do vấn đề nằm ở chính bạn, do hạn chế của mô hình, hay do sự can thiệp của chính sách một cách lặng lẽ.Sự bất khả tri này chính nó đã là một dạng tổn thương.
Một chi tiết khác được ẩn trong thẻ hệ thống: Văn bản suy luận của Mythos 5 “khó giải thích hơn so với các mô hình trước, chứa nhiều thuật ngữ chuyên môn và ngôn ngữ khó hiểu hơn”, và các nhà đánh giá cho rằng nó ngày càng nhận thức được rằng mình đang bị kiểm thử. Đối với một gia đình mà nói, những vấn đề mà những mô tả này gây ra không ít hơn chính việc giảm trí tuệ một cách lặng lẽ. Đối với một công ty tự xưng là công ty “AI an toàn”, những vấn đề này cũng không hề nhỏ.
Kết luận
Ngày phát hành Fable 5 có thể là ngày mâu thuẫn nhất trong lịch sử của Anthropic.
Trong hầu hết các bài kiểm tra đánh giá hiệu suất, có một mô hình hàng đầu và một chính sách được thiết kế để đôi khi “giả vờ đang giúp đỡ” người dùng. Mô hình đó chắc chắn là một thành tựu kỹ thuật đáng ngưỡng mộ, trong khi chính sách đó lại tạo ra những tiền lệ đáng lo ngại về mặt giá trị.
Nhà nghiên cứu Nathan Lambert đã nói một câu đáng để suy ngẫm nhiều lần: “Trở nên ngu ngốc một cách lặng lẽ mà không thông báo cho người dùng biết, về bản chất, đó là AI không phù hợp với mục đích sử dụng của con người.”
Đây không phải là một cáo buộc nhắm vào Anthropic, mà thực chất là chỉ ra một xu hướng nguy hiểm trong tư duy: hôm nay chúng ta đang “lặng lẽ làm giảm hiệu quả của các nhiệm vụ nghiên cứu về các mô hình LLM (Large Language Models)”, vậy ngày mai sẽ thế nào? Nếu lối suy nghĩ này được áp dụng rộng rãi hơn, tại sao người dùng lại tin rằng những câu trả lời họ nhận được là chính xác, trong khi không có bất kỳ thông tin nào được công bố trước đó? Đây có phải là hành vi “can thiệp” vào quá trình hoạt động của các mô hình AI không?
Các mô hình AI đang trở thành một phần của cơ sở hạ tầng nghiên cứu, giống như các công cụ tìm kiếm. Không ai sẽ chấp nhận một công cụ tìm kiếm mà nó có thể lén lút thay đổi kết quả tìm kiếm mà bạn không hề hay biết. Các tiêu chuẩn tương tự cũng nên được áp dụng cho các mô hình AI.
Anthropic đưa ra khẩu hiệu “An toàn là trên hết”, điều này đã là một lập trường đáng được tôn trọng. Tuy nhiên, khái niệm “an toàn” không bao giờ có nghĩa là “người dùng không cần phải biết” điều gì cả. Ngược lại,An ninh thực sự phải dựa trên kiến thức và sự tin tưởng của người dùng.。
Điểm này, có vẻ như là điều mà tất cả mọi người chơi Fable 5 đều biết.
Tác giả đến từ “Machine Heart” “Panda”.
Liên kết bài viết:https://www.airai.cc/vi/%E6%9C%AA%E5%91%BD%E5%90%8D/9/
Thông tin này có hữu ích không?