ЯАГААД ЭДЖ LLM-ууд БА БЯЦХАН ЗАГВАРУУД ЧУХАЛ ВЭ

AI Agents

Зохиогч: Win.AI Editorial

Engineer testing on-device AI: laptop showing a local LLM console and smartphone running an AI assistant, with a small development team bench in the background.

Миний дүгнэлт: эдж LLM-ууд нь хожигдол мэдрэмжтэй, нууцлалд анхаарсан онцлог шинж чанаруудын хувьд стандарт сонголт болж байгаа учир нь жижиг, хэмжигдсэн загварууд болон хосолсон хоолойнууд нь урьдчилан таамаглах боломжтой хожигдол мэдрэмжийг бий болгох бөгөөд өгөгдлийг илрүүлэхгүй, cloud төлбөрийг юуг ч эвдэхгүйгээр хүргэдэг. Энэ нь одоо хэрэгслийн байдал, загварын формат, ханган нийлүүлэгчийн бүтээгдэхүүнүүдэд илэрхий байна.

ЭДЖ LLM-УУД БОЛЗОХОД

Гар утасны урьдчилан таамаглахад хэрэгжих техникийн холболт нь одоо зөгнөлөг бус болжээ. llama.cpp төсөл болон GGUF хэмжигдэхүүн хэрэгсэлүүд нь 4-bit болон 8-bit загваруудыг утас, зөөврийн компьютер дээр ажиллуулахад өргөн хэрэглэгдэж, 1B-8B параметрийн загваруудыг энгийн тоног төхөөрөмж дээр ажиллуулж байгаа. Ollama нь Apple silicon-д зориулсан GGUF болон MLX хэрэгслүүдийг стандартчилж, олоход зориулсан загварын бүртгэл буюу локал гүйцэтгэгчид гэдгийг коммерциалчилжээ. Apple нь 2026 оны ICLR-д MLX загваруудыг M цуврал чипүүд дээр байнгын ажиллаж буй хэмжигдсэн загваруудын жишээг нийтэлсэн. Тэдгээр гурван шилжилт нь судалгааг ашиглахад сайжруулж байна.

ЯАГААД ЭДЖ LLM-УУД ЧУХАЛ ВЭ

Хожигдол нь зөвхөн секундэд дунджаар токентоор илэрхийлэгдэхгүй. Хэрэглэгчид сүүлчийн нь анзаардаг. Урьдчилан таамаглах болон энгийн үйлдвэрлэлийг төхөөрөмж дээр хамтлах үед 50-300 миллисекундын сүлжээний тойрох замыг орчин үеийн NPU болон GPU-д, ялангуяа Apple silicon болон Snapdragon флагмантай загварууд дээр нэг цифрийн декод хожигдол руу бууруулдаг. Нууцлал сайжирч байгаа учир цөөн тооны асуулт болон цөөн баримт бичгийн хэв загварууд төхөөрөмжөөс гарахгүй. Санхүүгийн зах зээл дагаж байна: 2026 оны дунд үеэс судалгаа, техник хэрэгсэл дээр оруулах хөрөнгө оруулалт нэмэгдэж, бага түвшний урьдчилан таамаглах оптимизациудад тогтвортой хөрөнгө оруулалт хийх чухал дохио болж байна.

Эсрэг байр суурь: хэмжигдэл болон түргэн шахалт нь үнэгүй биш. Саяхан GGUF болон сургалтын дараах хэмжигдэхүүнд хийсэн үнэлгээнүүд нь бага нөөцийн хэл болон зарим бүтээлч даалгавруудад хэмжигдэгдсэн чанарын хорогдолыг харуулсан. Энэ нь төхөөрөмж дээрх загварууд нь сүйрэл, гаргах, товчлох, олон төрлийн урьдчилан боловсруулалтын хувьд хамгийн тохиромжтой байж болзошгүйг илэрхийлж байна.

ЭДЖ БА CLOUD-ЫГ ЯАЖ СОНГОХ ВЭ

Гуравдагч элементээр: хожигдлын тэсвэр, нууцлалын эрсдэл, загвар шинэчлэл. Хэрэв таны онцлог нь 200 ms-аас бага хариу авч, эмзэг хэрэглэгчийн өгөгдөлд хүрч байвал төхөөрөмж дээрх жижиг загварыг анхны шатны шүүлтүүрээр анхаарч үзээрэй. Хэрэглэгчийн сэтгэлгээний загвар эсвэл маш том контекстын орон зай шаардлагатай бол, шүүлтүүрлэсэн хүсэлтүүдийг cloud загварт өгөх, хамгийн сүүлийн үеийн мэдээлэл болон урт контекстын санамжтай явуулах хэрэгтэй.

Бүтээгдэхүүний багууд хоёр инженерийн үнэн бодитой байдлыг ажиглах хэрэгтэй. Эхнийх нь дэд бүтэцийн насжилт: llama.cpp, Ollama, MLX болон браузер WebLLM зэрэг гүйцэтгэгчид загвар импорт, хэмжигдэхүүн, хуваарилалтыг тогтворжуулж байна. Хоёрдугаарт, шинэчлэлтийн зардал: баталгаажсан төхөөрөмж дээрх загварыг илгээх нь бага гүйцэтгэлийн зардалтай тул шинэчлэлтийн зөөвөрлөгч, апп дэлгүүрийн эргэлттэй харьцангуй таглалын төвшин хүртэлх буулгадаг. Энэ нь шийдэгдэж болох бөгөөд замын картын хэсэг байх ёстой.

Практик дээр бид нийтлэг загварыг ажигласан: жижиг хэрэглээний загварууд хэрэггүй cloud дуудлагуудыг багасгах, хожигдлын сүүлчийг зөөллөхөөс сэргийлсэн. Бид бас нэг загварыг ажигласан: төхөөрөмжийн загварыг тодорхой шүүлтүүртэй хандах баг түвшин хариу өгч байна. Багууд үүнийг шийдэх үед хамгийн бага битийн хэмжигдлийн үед хэл, салбарын бууралт байж болзошгүй; нэг ашиглалтын хувьд план гаргах хэрэгтэй.

ӨӨРТ МЭДЭЭЛЭЭР СУДЛАХ

Доорх асуултууд нь та түүний санааг туршиж үзэхийн тулд локал жижиг загварын гүйцэтгэгчид оруулах боломжтой хоёр практик хосолсон загварыг харуулна.

Энэ асуулт нь хэрэглэгчийн асуулт cloud дуудлага шаардлагатай эсэхийг шүүлтэрлэх болно. call_cloud үнэн эсвэл худал болж хариу өгч, богино шалтгаан гарахыг хүлээж авна.

Та шүүлтүүрийн агент байна. "input" талбарт хэрэглэгчийн мессежийг харгалзуулан, энэ нь урт хугацааны сэтгэхүйд cloud LLM шаардлагатай эсэхийг шийдвэрлээрэй, эсвэл төхөөрөмж локал хариу өгч болох уу. Valid JSON-ыг гуравнуудын түлхүүрүүдтэй (call_cloud (үнэн эсвэл худал), шалтгаан (нэг богино өгүүлбэр), болон local_action (call_cloud буруу байвал төхөөрөмж хийх заавар)) булсан хариу илгээ.
Оролт: "{{user_input}}"

Энэ асуулт нь зургийн болон богино тайлбараас бүтэцтэй мэдээлэл гарган авах бөгөөд төхөөрөмжийн олонжигоор урьдчилан боловсруулалтын үед зөвхөн зайлшгүй талбарт forwarding хийхэд ашигладаг.

Та төхөөрөмжийн харааны гаргалгааны агент байна. Нэг өгүүлбэрт гол объектын тодорхойлолтыг өг. Дараа нь caption, objects (нэрсийн жагсаалт), болон sensitive (зураг нь хувийн ID, kredit карт, эсвэл бусад нууц мэдээлэл агуулсан тохиолдолд үнэн) түлхүүрүүдтэй JSON объект буцаана. Ямар ч текстийн нэр томьёо ашиглахгүй.
Зураг: [зурагийн байт оруулах].

Бүтээгдэхүүний дүгнэлт: жижиг төхөөрөмжийн загваруудыг cloud дуудлагатай хослуулан, таны хэл болон даалгаваруудад чанарын уналтыг хэмжих, загварыг шинэчлэхийн тулд апп шинэчлэлийн хугацааг төсөвлөх. Агентын урсгалаас, AI агентууд, чатботуудын ялгаа зэрэг гүнзгий үйл ажиллагааны загварууд болон алдааны загваруудын талаар манай гарын авлагад хандаарай.

Хамааралтай

Вирал загварууд

Манай вирал AI загваруудыг судалж, зургаадаа хэрэглээрэй.

Загваруудыг судлах