Đánh giá Grok 4.6: cách mà xAI so với GPT-5.6 và Opus hiện nay

News

Bởi Win.AI Editorial

Engineer at a desk testing Grok 4.6 on a laptop showing code, a waveform playback panel, and an xAI dashboard on a second monitor.

Đánh giá Grok 4.6: bản cập nhật của xAI thu hẹp khoảng cách về lý luận kỹ thuật với GPT-5.6 nhưng không xóa bỏ những lợi thế về hệ sinh thái và an toàn mà OpenAI và Anthropic nắm giữ.

Những gì thay đổi trong đánh giá Grok 4.6

Ghi chú phát hành và tài liệu cho nhà phát triển của xAI cho biết Grok 4.6 bổ sung một buổi đào tạo bổ sung dài hơn, dữ liệu do mô hình tạo ra được chọn lọc cho lý luận, công cụ đầu ra có cấu trúc và một điểm cuối Speech to Speech có tên là grok-voice-think-fast-1.0. Ghi chú phát hành cũng cho thấy giá công cụ của tác nhân đã giảm và API có sẵn ngay lập tức. Những điều đó là những thay đổi cụ thể của nền tảng, chuyển trọng tâm từ độ chính xác của mô hình thuần túy sang tự động hóa từ đầu đến cuối. Thông báo có trên trang web của xAI và trong thẻ mô hình Grok 4.6.

Đối đầu: nơi Grok thực sự chiến thắng và nơi nó không chiến thắng

Trong các nhiệm vụ tác nhân nhiều bước và các lời nhắc kỹ thuật, Grok 4.6 thường xuyên sản xuất các kế hoạch có cấu trúc và đoạn mã có thể thực thi chính xác trong các thử nghiệm của chúng tôi và trong nhiều bản trình diễn công khai. xAI ưu tiên các tác nhân chạy lâu và chuỗi công cụ, và tài liệu cũng như ghi chú phát hành của họ phản ánh sự nhấn mạnh đó. Điều đó quan trọng vì việc cung cấp một quy trình làm việc tự động cần các đầu ra có cấu trúc có thể dự đoán nhiều hơn là những cải tiến lề trong chất lượng hoàn thành miền mở.

Gia đình GPT-5.6 của OpenAI vẫn mạnh hơn trong lý luận bị hạn chế, có độ rủi ro cao nơi mà các biện pháp bảo vệ và nguồn gốc quan trọng. Bản xem trước và các trang trợ giúp của GPT-5.6 của OpenAI cho thấy bản phát hành này đã được phát hành với các biện pháp kiểm soát nghiêm ngặt hơn và nhấn mạnh vào các biện pháp an toàn. Dòng Opus của Anthropic tiếp tục cạnh tranh về các nguyên lý can thiệp và các kiểm soát chính sách tinh vi; các bản theo sau Opus 5 giải thích chiến lược cập nhật liên tục và sự tập trung vào doanh nghiệp. Đối với những độc giả muốn tìm hiểu thêm về Opus, xem bài viết trước của chúng tôi tại đây. Đối với việc phát hành rộng rãi hơn của OpenAI cho GPT-5.6, hãy xem phần giải thích của chúng tôi tại đây.

Những đánh đổi thực tế là rõ ràng. Grok 4.6 rẻ hơn theo mỗi token và tối ưu hóa cho việc gọi công cụ, giọng nói và độ bền của tác nhân. Điều đó làm giảm chi phí kỹ thuật cho tự động hóa lâu dài. Lập luận ngược lại là rằng chi phí thấp hơn mỗi lần gọi và vòng lặp tác nhân nhanh hơn có thể làm tăng phạm vi ảnh hưởng của việc sử dụng sai trừ khi công cụ quản trị đi kèm theo. OpenAI và Anthropic vẫn dẫn đầu trong các công cụ an toàn đã được xây dựng sẵn, triển khai từng mức độ và các tính năng tuân thủ.

Triển khai và ảnh hưởng cạnh tranh

Sự tích hợp chặt chẽ của xAI với SpaceX và sự sẵn có của API nhanh chóng rút ngắn thời gian từ bản cập nhật mô hình đến sản xuất. API quản lý của SpaceXAI và các trang mô hình cho thấy các nhóm có thể khởi động grok-4.6 trên nền tảng ngay hôm nay. Mong đợi áp lực giá trên toàn bộ các sản phẩm của nhà cung cấp. Ước tính của tôi là Grok 4.6 sẽ thúc đẩy các đối thủ cạnh tranh cắt giảm giá gọi tác nhân trong vòng vài tháng vì tác nhân là nơi chi phí hội tụ. Đó là một dự đoán hợp lý, không phải một dự đoán chính xác; nó giả định rằng tình hình sẽ duy trì và không có sự chậm trễ quy định lớn.

Chúng tôi đã quan sát ba mô hình hoạt động trong quá trình thử nghiệm công khai và báo cáo từ cộng đồng: các công cụ đầu ra có cấu trúc của Grok giảm thời gian kỹ thuật lời nhắc cho các quy trình, S2S âm thanh nhanh hơn một cách đáng kể khi các bản sao chữ chính xác, và các thất bại trong chuỗi công cụ vẫn xuất hiện từ các giao diện công cụ giòn thay vì các lỗi lý luận cốt lõi. Một vấn đề gặp phải trong các lần chạy công khai là sự tự tin quá mức khi Grok tạo ra các đầu ra công cụ; để bảo vệ chống lại điều đó cần phải xác minh bên ngoài.

Hãy tự trải nghiệm

Lời nhắc này chứng minh việc kết nối Grok 4.6 để tạo ra một kế hoạch tự động ngắn và một sơ đồ JSON mà bạn có thể phân tích thành một công cụ thực hiện công việc. Mong đợi một kế hoạch compact và một sơ đồ nghiêm ngặt mà bạn có thể xác thực.

Tạo một kế hoạch tự động từng bước để tiếp nhận một báo cáo doanh số CSV hàng tuần, chuẩn hóa các cột và gọi một API bên ngoài để lưu trữ kết quả. Chỉ trả về JSON với các khóa: steps, inputs, validation_checks, api_calls. Giữ số bước ít hơn bảy mục.

Lời nhắc này kiểm tra lý luận giọng nói của Grok 4.6 bằng cách yêu cầu một tóm tắt hành động và một cụm từ nói trong 10 giây phù hợp cho một clip giọng nói thông báo.

Tóm tắt kế hoạch tự động trên thành hai câu ngắn gọn phù hợp cho một thông báo âm thanh ngắn. Sau đó cung cấp một cụm từ nói trong 10 giây dưới dạng văn bản thuần túy cho một công cụ chuyển văn bản thành giọng nói, được dán nhãn "tts_text".

Grok 4.6 là một lựa chọn thực tiễn, rẻ hơn mà thực sự nâng cao tiêu chuẩn trong quy trình làm việc ưu tiên tác nhân. Những khoảng cách còn lại là quản trị, nguồn gốc và hệ sinh thái bên thứ ba rộng lớn hơn nơi mà OpenAI và Anthropic vẫn giữ ưu thế.

Liên quan

Mẫu viral

Khám phá các mẫu AI viral của chúng tôi và áp dụng vào ảnh của bạn.

Khám phá mẫu