Anthropic Opus 5: điều gì có ý nghĩa với AI doanh nghiệp hôm nay

News

Bởi Win.AI Editorial

Engineering team in a conference room reviewing an Opus 5 migration dashboard showing token usage and effort-level controls on a large monitor

Anthropic Opus 5 mang lại khả năng cạnh tranh cho doanh nghiệp với giá của Opus 4.8 bằng cách thêm một núm điều chỉnh nỗ lực, cho phép thương lượng giữa độ sâu lý luận với chi phí token, và sự thay đổi đơn lẻ đó sẽ buộc người mua phải coi việc nâng cấp mô hình là những lần di chuyển thường xuyên và không tầm thường. Anthropic đã ra mắt Opus 5 vào ngày 24 tháng 7 năm 2026, và tài liệu nền tảng cũng như bài viết của Reuters cho thấy mô hình được phát hành với mức giá $5 cho mỗi triệu đầu vào và $25 cho mỗi triệu đầu ra như Opus 4.8, đồng thời tuyên bố đạt hiệu suất gần như Fable trong nhiều tiêu chí kiểm tra.

Anthropic Opus 5: khả năng, chi phí, an toàn

Opus 5 tiết lộ tham số output_config.effort với năm mức từ thấp đến tối đa để mỗi yêu cầu có thể thương lượng chi phí cho tư duy sâu hơn. Tài liệu ra mắt của Anthropic và hướng dẫn di chuyển mô tả núm điều chỉnh này thay đổi số lượng token lý luận nội bộ và gọi công cụ mà mô hình tiêu tốn, không chỉ đơn thuần là một giới hạn token cứng. Điều này cho phép các đội thực hiện các quy trình làm việc hàng ngày với nỗ lực thấp để giảm thiểu việc tiêu tốn token, sau đó chuyển sang nỗ lực cao cho các nhiệm vụ phức tạp. Công ty đã công bố các tuyên bố benchmark so sánh Opus 5 với Opus 4.8 và Fable 5; Reuters và Fortune đã tóm tắt những tuyên bố đó và ghi nhận vị trí rõ ràng của Anthropic khi xác định Opus 5 là rẻ hơn cho nhiều công việc kinh doanh thực tế.

Các thay đổi về an toàn là dần dần. Opus 5 kế thừa các rào cản của Opus 4.8 và thắt chặt một số từ chối liên quan đến mạng so với các phiên bản Opus trước, theo thông tin của Fortune về buổi ra mắt. Các nghiên cứu nhóm đỏ độc lập vẫn là biện pháp kiểm tra đáng tin cậy nhất chống lại các tuyên bố quá lạc quan từ nhà cung cấp. Đánh giá nhóm đỏ gần đây trên arXiv nhắm tới Fable và các mô hình Opus trước cho thấy an toàn là yếu dưới các cuộc tấn công thích ứng, vì vậy doanh nghiệp không nên giả định rằng việc tăng cường khả năng đồng nghĩa với việc căn chỉnh mạnh mẽ.

Di chuyển, phiên bản và MLOps

Tác động thực tế là sự xáo trộn. Nếu bạn đã điều chỉnh các prompt, chuỗi công cụ, hoặc mô hình đánh giá cho Opus 4.8, thì việc chuyển sang Opus 5 có thể thay đổi số lượng token, hành vi gọi công cụ và hình dạng đầu ra. Hướng dẫn di chuyển của Anthropic cảnh báo rõ ràng các đội phải tái lập token hóa và độ trễ. Người dùng nên mong đợi ba hành động này trước khi di chuyển toàn bộ: chạy lại token hóa trên các khối công việc thực tế, phát lại các bài kiểm tra tự động kiểm tra các lần gọi công cụ và các lần phục hồi lỗi, và lập mức thiết lập nỗ lực theo từng điểm cuối.

Nhiều người mua sẽ coi Opus 5 như một sự tối ưu hóa chi phí chứ không phải là một sự thay thế đơn giản. Điều đó đặt ra các câu hỏi về việc mua sắm: liệu SLAs có bao gồm sự suy giảm ngữ nghĩa giữa các phiên bản, và liệu kiểm soát thay đổi của nhà cung cấp có cho phép giữ lại một phiên bản con cụ thể không? Bước thực tế ngắn gọn là thêm các cổng phiên bản mô hình vào CI và bố trí ngân sách cho 2 đến 6 tuần điều chỉnh lại cho mỗi phiên bản lớn của Opus. Đối với các mẫu kiến trúc được khuyến nghị, xem hướng dẫn RAG thực tiễn của chúng tôi cho doanh nghiệp.

Chúng tôi đã quan sát thấy ba mẫu lặp lại trong thời gian gần đây của việc xáo trộn mô hình. Đầu tiên, những thay đổi nhỏ trong prompt mà hoạt động trên Opus 4.8 đôi khi tạo ra các chuỗi lý luận khác nhau trên Opus 5. Thứ hai, mức nỗ lực thấp thường giảm thiểu chi phí gọi công cụ mà không làm giảm chất lượng cho các tóm tắt và trích xuất. Thứ ba, những lần phục hồi an toàn nơi Opus từ chối và sau đó chuyển hướng sang một mô hình nhỏ hơn tạo ra những đỉnh độ trễ tinh tế cần thử nghiệm tải.

Thử nghiệm bản thân: các prompt

Hai prompt sau đây cho thấy cách bộc lộ núm điều chỉnh nỗ lực trong công việc thực và kiểm tra hành vi tự xác minh của Opus 5. Mong đợi mô hình sẽ tiêu tốn nhiều token hơn và tạo ra nhiều kiểm tra nội bộ hơn ở mức nỗ lực cao hơn.

Prompt này so sánh một công việc làm sạch dữ liệu định kỳ với nỗ lực thấp và một việc tái cấu hình phức tạp với nỗ lực tối đa. Dán hai lần chỉ với nhãn nỗ lực thay đổi để thấy sự khác biệt về token và đầu ra.

Task: Sửa chữa và tái cấu trúc quy trình dữ liệu Python lộn xộn này để loại bỏ mất mát dữ liệu không âm thanh, thêm kiểm thử đơn vị và tóm tắt các thay đổi. Trả lại một changelog ngắn, hàm được tái cấu trúc, và hai trường hợp kiểm thử. Effort: low

Prompt này yêu cầu mô hình tìm và sửa chữa những sai lầm của chính mình và giải thích những gì đã thay đổi. Sử dụng điều này để kiểm tra hành vi xác minh của Opus 5 và xem liệu nó có phục hồi mà không cần prompt của con người không.

Task: Viết một kế hoạch 6 bước để trích xuất thực thể từ một CSV 10.000 dòng, sau đó thực hiện một cuộc tự kiểm toán liệt kê các chế độ thất bại có thể và sửa chữa kế hoạch. Nếu bạn phát hiện một vấn đề, viết lại bước bị ảnh hưởng. Effort: max

Phản đối rõ ràng là các tuyên bố của nhà cung cấp sẽ được phóng đại cho đến khi các tiêu chí kiểm tra độc lập tái tạo chúng. Điều đó là đúng. Hãy coi số liệu của Anthropic như một hướng dẫn, chạy lại các khối công việc tương tự và dự toán cho công việc di chuyển thay vì giả định sự tương thích ngay lập tức.

Liên quan

Mẫu viral

Khám phá các mẫu AI viral của chúng tôi và áp dụng vào ảnh của bạn.

Khám phá mẫu