Kimi K3 weights mở: tự lưu trữ, điểm chuẩn, an ninh

News

Bởi Win.AI Editorial

Racks of server GPUs and technicians preparing a multi-node cluster for large-model inference, with a diagram showing sharded weights being loaded across machines.

Kimi K3 cung cấp một mô hình biên giới 2,8 triệu tham số có thể tải xuống, nhưng việc tải xuống không đồng nghĩa với việc vận hành nó một cách hiệu quả về chi phí. Moonshot đã phát hành các trọng số mở với bối cảnh 1.048.576 token và thiết kế Mixture of Experts phân tán; kết quả là cơ hội chưa từng có cộng với giới hạn hoạt động có thể đoán trước.

Ý nghĩa của Kimi K3 đối với việc tự lưu trữ

Moonshot mô tả Kimi K3 như là một MoE phân tán 2,8T với khoảng 896 chuyên gia và một mẫu kích hoạt sử dụng một tập hợp nhỏ các chuyên gia cho mỗi token, và tài liệu với ghi chú phát hành khẳng định rằng có khoảng cửa sổ bối cảnh 1 triệu token và khoảng 104 tỷ tham số được kích hoạt cho các yêu cầu điển hình. Những thông tin chi tiết này đến từ phát hành kỹ thuật Kimi K3 của Moonshot và bài báo đi kèm trên arXiv, và đổi chi phí cố định của các mô hình dày đặc lấy một hồ sơ suy diễn chi phí biến thiên. Hệ quả thực tiễn rất đơn giản. Nếu bạn muốn tự lưu trữ thực sự, bạn cần một cụm GPU đa nút, mạng cho bộ nhớ KV cache và một stack suy diễn hiểu biết về định tuyến phân tán và trút tải. Các đội nhỏ sẽ nhanh chóng gặp rắc rối về chi phí và tích hợp.

Chắc chắn rằng sự phát hành này sẽ thúc đẩy các stack phục vụ bên thứ ba và các runtime đã định lượng. Nhận định của Hugging Face và ghi chú từ cộng đồng cho thấy định lượng MXFP4 và các runtime kiểu vLLM đã là các mục tiêu tương thích đầu tiên. Đối với các khách hàng doanh nghiệp cần kiểm soát cục bộ hoặc để tránh luồng dữ liệu API, việc tự lưu trữ bây giờ trở nên khả thi về nguyên tắc chứ không chỉ qua việc thương thảo. Xem bài viết trước của chúng tôi về việc triển khai LLM riêng tư cho những cân nhắc RAG thực tế.

Điểm chuẩn và sự trao đổi chi phí suy diễn

Các điểm chuẩn được công bố cùng với phát hành đặt Kimi K3 gần các mô hình biên giới trong các nhiệm vụ suy diễn và duyệt web, nhưng các con số đó phụ thuộc vào quy trình tối ưu hóa và lựa chọn định lượng của chính Moonshot. Các bản tái sản xuất độc lập đang xuất hiện nhưng thay đổi theo runtime và định lượng. Các báo cáo sớm từ cộng đồng và ghi chú phần cứng từ báo chí ngành cũng chỉ ra rằng Moonshot đã sử dụng các bộ tăng tốc kiểu Blackwell gần đây trong quá trình huấn luyện, điều này nâng cao tiêu chuẩn cho bất kỳ ai cố gắng tái tạo việc huấn luyện tại chỗ.

Toán học chi phí rất quan trọng. Với lưu trữ 4-bit gốc, một mô hình 2,8T vẫn chiếm terabyte trọng số khi bạn bao gồm bộ nhớ KV cache và bộ đệm kích hoạt. Điều đó ngụ ý hàng tá GPU loại 80 GB cho phục vụ độ trễ thấp hoặc các đường ống phân tán cẩn thận với độ trễ cao hơn và nhiều chế độ thất bại phức tạp hơn. Sự trao đổi mà bạn nhận được với MoE phân tán là FLOPs trên mỗi token thấp hơn cho suy diễn dài hạn, nhưng độ biến động độ trễ cao hơn và yêu cầu bộ nhớ và lịch trình phức tạp hơn.

Bề mặt an ninh và lạm dụng

Các trọng số mở thay đổi mô hình đe dọa. Với các trọng số công khai, kẻ thù có thể chạy toàn bộ mô hình ngoại tuyến, thăm dò các chế độ thất bại và tạo ra jailbreak mà không cần ghi lại số liệu API. Các ghi chú phát hành của Moonshot và tin tức bảo mật nhấn mạnh rằng quyền truy cập mở loại bỏ một lớp kiểm soát trước đây được cung cấp bởi các API lưu trữ. Do đó, các doanh nghiệp phải coi mô hình như là một thành phần không đáng tin cậy, và áp dụng mô hình đe dọa, đội đỏ, và các lớp bảo vệ an toàn trong thời gian hoạt động giống như họ sẽ đối với các phụ thuộc nhị phân bên thứ ba. Cuốn sổ tay an ninh của chúng tôi giải thích sự thay đổi hoạt động này.

Chúng tôi đã quan sát thấy ba mô hình thực tiễn cho đến nay. Thứ nhất, việc phát hành trọng số mở nhanh chóng tạo ra các nhánh tối ưu hóa và các lớp bọc suy diễn. Thứ hai, định lượng và trút tải giảm VRAM nhưng tăng độ biến động độ trễ và độ phức tạp trong quá trình gỡ lỗi. Thứ ba, rủi ro pháp lý và quyền tài phán thường là điều khiến các tổ chức cố gắng tự lưu trữ mặc dù chi phí.

Thử nghiệm chính bạn

Lệnh bên dưới minh họa khả năng tóm tắt bối cảnh lớn của K3; mong đợi nó yêu cầu một runtime phát luồng các token và quản lý một KV cache dài.

Bạn là một nhà phân tích chuyên gia. Tóm tắt tài liệu dưới đây thành một bản tóm tắt điều hành 12 điểm nhấn mạnh các quyết định, thời hạn và rủi ro chưa được giải quyết. Bảo tồn tiêu đề phần và chỉ ra các offset token ước tính cho mỗi quyết định. Bắt đầu khi tôi dán tài liệu.

Lệnh tiếp theo kiểm tra sự đồng bộ đa phương tiện khi cung cấp các biên bản dài cộng với hình ảnh; mong đợi mô hình sẽ tham chiếu cả hai phương thức trong khoảng cửa sổ 1 triệu token.

Bạn sẽ phân tích báo cáo sự cố đa phương tiện chứa hình ảnh và một biên bản 200k-token. Trích xuất một dòng thời gian với các dấu thời gian, đính kèm tên tệp hình ảnh liên quan nhất với mỗi sự kiện, và đánh dấu các tuyên bố cần được xác nhận. Chờ tải lên tệp đính kèm và dán biên bản.

Việc phát hành là một bước ngoặt cho các hệ sinh thái mô hình mở. Công nghệ rất khả thi và thú vị. Sự chấp nhận của nó sẽ được quyết định bởi ai thanh toán hóa đơn suy diễn và ai chấp nhận gánh nặng an ninh mở rộng.

Mẫu viral

Khám phá các mẫu AI viral của chúng tôi và áp dụng vào ảnh của bạn.

Khám phá mẫu