Kimi K3 เปิดน้ำหนัก: การใช้เซิร์ฟเวอร์เอง, มาตรฐานการทดสอบ, ความปลอดภัย
โดย Win.AI Editorial

Kimi K3 ทำให้โมเดลพัฒนาใหม่ที่มีพารามิเตอร์ 2.8 ล้านล้านสามารถดาวน์โหลดได้ แต่การดาวน์โหลดไม่เท่ากับการรันอย่างมีประสิทธิภาพ Moonshot ส่งน้ำหนักที่เปิดเผยพร้อมกับบริบท 1,048,576 โทเคนและการออกแบบ Mixture of Experts ที่เบาบาง ผลลัพธ์คือโอกาสที่ไม่เคยมีมาก่อนควบคู่กับขีดจำกัดในการดำเนินงานที่คาดการณ์ได้。
Kimi K3 หมายถึงอะไรสำหรับการใช้เซิร์ฟเวอร์เอง
Moonshot ระบุตัว Kimi K3 ว่าเป็น MoE ที่เบาบาง 2.8 ล้านล้าน โดยมีผู้เชี่ยวชาญประมาณ 896 คนและรูปแบบการทำงานที่ใช้ผู้เชี่ยวชาญชุดเล็กต่อโทเคน และเอกสารและบันทึกการเปิดเผยระบุหน้าต่างบริบทประมาณ 1M โทเคนและประมาณ 104 พันล้านพารามิเตอร์ที่ถูกเปิดใช้งานสำหรับคำขอทั่วไป ข้อมูลเหล่านี้มาจากการเปิดเผยทางเทคนิคของ Kimi K3 ของ Moonshot และเอกสาร arXiv ที่มากับกัน และแลกเปลี่ยนต้นทุนคงที่ของโมเดลที่หนาแน่นกับโปรไฟล์การอนุมานที่มีต้นทุนแปรผัน ผลที่เป็นไปได้ในทางปฏิบัติก็คือ หากคุณต้องการการใช้เซิร์ฟเวอร์เองอย่างแท้จริง คุณจะต้องมีกลุ่ม GPU หลายโหนด, เครือข่ายสำหรับแคช KV, และสแต็คการอนุมานที่เข้าใจการจัดเส้นทางที่เบาบางและการออฟโหลด ทีมขนาดเล็กจะประสบกับความยุ่งยากเรื่องค่าใช้จ่ายและการบูรณาการอย่างรวดเร็ว
แน่นอนว่าการเปิดตัวจะกระตุ้นให้มีการสร้างสแต็คการให้บริการจากบุคคลที่สามและการรันไทม์ที่มีการปรับขนาด ความเห็นจาก Hugging Face และบันทึกจากชุมชนแสดงให้เห็นว่า MXFP4 การควอนไทเซชันและสไตล์การรันไทม์ vLLM เป็นเป้าหมายการทำงานร่วมกันที่แรกร่วมอยู่แล้ว สำหรับลูกค้าในองค์กรที่ต้องการการควบคุมในพื้นที่หรือหลีกเลี่ยงการไหลข้อมูล API การใช้เซิร์ฟเวอร์เองจึงกลายเป็นไปได้ในทางทฤษฎีมากกว่าที่จะเป็นเพียงแค่การเจรจา ดูข้อมูลพื้นฐานก่อนหน้านี้เกี่ยวกับการใช้งาน LLM ส่วนตัวสำหรับการพิจารณา RAG อย่างเป็นปฏิบัติ
มาตรฐานการทดสอบและการค้าขายค่าใช้จ่ายในการอนุมาน
มาตรฐานการทดสอบที่เผยแพร่พร้อมกับการเปิดตัววาง Kimi K3 ใกล้กับโมเดลพัฒนาใหม่ในงานด้านการให้เหตุผลและการท่องเว็บ แต่ตัวเลขเหล่านั้นขึ้นอยู่กับพายพานที่ปรับแต่งของ Moonshot และทางเลือกในการควอนไทเซชัน การทำซ้ำอิสระเริ่มเกิดขึ้นแต่มีความแตกต่างตามการรันไทม์และการควอนไทเซชัน รายงานจากชุมชนในช่วงต้นและบันทึกฮาร์ดแวร์จากสื่ออุตสาหกรรมยังบอกเป็นนัยว่า Moonshot ใช้ตัวเร่งความเร็วระดับ Blackwell ขณะที่ฝึกฝน ซึ่งยกระดับมาตรฐานสำหรับผู้ที่พยายามจะซ้ำการฝึกฝนในท้องถิ่น
การคำนวณต้นทุนมีความสำคัญ ในการจัดเก็บที่ 4-bit แบบพื้นฐาน โมเดล 2.8 ล้านล้านยังคงต้องใช้พื้นที่เก็บถาวรอยู่ในเทราไบต์เมื่อคุณรวมแคช KV และบัฟเฟอร์การเปิดใช้งาน ซึ่งหมายความว่าต้องใช้ GPU ขนาด 80 GB หลายร้อยตัวสำหรับการให้บริการที่มีความหน่วงต่ำ หรือการทำงานร่วมกับพายพานที่ถูกแบ่งชิ้นที่มีความหน่วงสูงขึ้นและโหมดการล้มเหลวที่ซับซ้อนมากขึ้น ข้อตกลงที่คุณได้รับจาก MoE ที่เบาบางคือ FLOP ต่อโทเคนที่ต่ำลงสำหรับการให้เหตุผลที่ต้องคำนวณนาน แต่มีความแปรปรวนสูงขึ้นในความหน่วงและความต้องการในด้านหน่วยความจำและการจัดตารางที่ซับซ้อนมากขึ้น
ความปลอดภัยและพื้นที่การละเมิด
น้ำหนักที่เปิดเผยเปลี่ยนโมเดลความเสี่ยง ด้วยน้ำหนักที่เป็นสาธารณะ คู่แข่งสามารถรันโมเดลทั้งหมดแบบออฟไลน์ สำรวจโหมดการล้มเหลว และสร้างการหลบหนีโดยไม่ต้องใช้ข้อมูลการตรวจสอบ API บันทึกการเปิดเผยของ Moonshot และการรายงานในสื่อด้านความปลอดภัยเน้นย้ำว่าการเข้าถึงแบบเปิดลบชั้นการควบคุมที่เคยจัดให้โดย API ที่โฮสต์ไว้ ดังนั้นองค์กรต้องถือว่าโมเดลนั้นเป็นส่วนประกอบที่ไม่น่าเชื่อถือ และนำโมเดลความเสี่ยง, ทีมสีแดง และการหุ้มความปลอดภัยในระหว่างการทำงานมาใช้ในลักษณะเดียวกับที่พวกเขาทำกับการพึ่งพาไบนารีจากบุคคลที่สาม คู่มือด้านความปลอดภัยของเราอธิบายการเปลี่ยนแปลงการดำเนินงานนี้
เราพบรูปแบบที่ใช้ได้จริงสามประการจนถึงปัจจุบัน อย่างแรก การเปิดน้ำหนักอย่างรวดเร็วทำให้เกิดการสร้างต้นแบบและบัคเก็ตการอนุมานที่มีการปรับแต่งอย่างรวดเร็ว อย่างที่สอง การควอนไทเซชันและการออฟโหลดช่วยลด VRAM แต่เพิ่มความแปรผันในความหน่วงและความซับซ้อนในการแก้ไข อย่างที่สาม ความเสี่ยงทางกฎหมายและเขตอำนาจศาลมักเป็นสิ่งที่ผลักดันให้องค์กรลองใช้เซิร์ฟเวอร์ของตนเองแม้จะมีค่าใช้จ่าย
ลองด้วยตัวคุณเอง
คำสั่งด้านล่างสาธิตการสรุปเนื้อหาขนาดใหญ่ของ K3 คาดว่าจะต้องการรันไทม์ที่สตรีมโทเคนและจัดการแคช KV ที่ยาว
คุณเป็นนักวิเคราะห์ผู้เชี่ยวชาญ สรุปเอกสารต่อไปนี้เป็นบันทึกบริหารเรื่องย่อ 12 จุดที่เน้นการตัดสินใจ ข้อกำหนดเวลา และความเสี่ยงที่ยังไม่ได้แก้ไข เก็บหัวข้อของแต่ละส่วนและระบุระยะเวลาโทเคนโดยประมาณสำหรับการตัดสินใจแต่ละข้อ เริ่มเมื่อดิฉันวางเอกสาร
คำสั่งถัดไปทดสอบความสอดคล้องของหลายสื่อเมื่อป้อนสคริปต์ยาวพร้อมกับภาพ คาดว่าโมเดลจะอ้างอิงถึงทั้งสองโมดัลทั่วหน้าต่าง 1M โทเคน
คุณจะวิเคราะห์รายงานเหตุการณ์หลายโมดัลที่มีภาพและสคริปต์ 200k โทเคน ดึงไทม์ไลน์พร้อมกับการตีความเวลาที่แนบมาด้วย, แนบชื่อไฟล์ภาพที่เกี่ยวข้องที่สุดต่อเหตุการณ์แต่ละอัน, และระบุข้อความที่ต้องการการรับรอง รอการอัปโหลดเอกสารแนบและวางสคริปต์
การเปิดตัวนี้เป็นจุดเปลี่ยนสำหรับระบบนิเวศของโมเดลแบบเปิด เทคโนโลยีมีความสามารถและน่าสนใจ การนำไปใช้งานจะถูกตัดสินโดยใครเป็นผู้จ่ายค่าใช้จ่ายในการอนุมานและใครยอมรับภาระทางด้านความปลอดภัยที่ขยายออกไป




