ტოკენიზაცია ახსნილი: ტოკენებიდან გამომავალი შედეგები

Blog

ავტორი: Wendy Frey

26702eff-dbff-43b4-a5fb-fb97eab89247-1200x600.webp

დიდი ენობრივი მოდელის გაწვდილი რაიმე სასარგებლოს გამოადგება, უნდა გააკეთოს რაღაც უფრო მარტივი პირველი: თქვენი ტექსტი გაწვდოს.

გარდა ამისა, ეს პროცესი სახელწოდებად ეწოდება ტოკენიზაცია, და ეს თანამედროვე ხელოვნური ინტელიგენციის სისტემების მუშაობის ერთ-ერთი ყველაზე მნიშვნელოვანი და დანიშნულების overlooked ნაწილებია.

დიდი ხალხი თვლის, რომ მოდელები სიტყვებს კითხულობენ. ისინი არ კითხულობენ.

ისინი კითხულობენ ტოკენს: ტექსტის მცირე ნაწილებს, რომლებიც შეიძლება წარმოადგენდნენ სრულ სიტყვებს, სიტყვების ნაწილებს, პუნქტუაციას, სივრცეებს, ან ინდივიდუალურ სიმბოლოებს. შემდეგ ეს ტოკენები გადაქცევა ხდება რიცხვულ ID-ებად, რომლებიც მოდელს შიგნით გადაამუშავებს.

ტოკენიზაციის გაგება ბევრ რამეს ფარავს:

  • რატომ იხდის თანხას პრომპტები
  • რატომ აქვს კონტექსტის ფანჯრებს შეზღუდვები
  • რატომ არის ზოგი ენა უფრო ძვირი, ვიდრე სხვა
  • რატომ იქცევიან მოდელები ზოგჯერ უცნაურად

ტოკენიზაცია ხელოვნური ინტელიგენციის პროცესის დასაწყისშია და ჩუმად ფორმირებს ყველაფერს, რაც შემდეგ ხდება.

რა არის ტოკენი?

ტოკენი არის ტექსტის უმცირესი ერთეული, რაც მოდელი მუშაობს.

ეს არ არის ყოველთვის იგივე რაც სიტყვა.

მაგალითად:

ტექსტიშესაძლო ტოკენის გაწვდილი
გამარჯობაგამარჯობა
ტოკენიზაციატოკენ + ოპტიმიზაცია
დაუჯერებელიუნ + დასჯილი + აშვება
2026!202 + 6 +!

ეს მნიშვნელოვანია იმიტომ, რომ მოდელები ითვლიან ტოკენებს, მაშინ როცა სიტყვებს - არა.

მოკლე ტექსტი შესაძლოა მოითხოვდეს მეტ ტოკენს, ვიდრე მოსალოდნელი იყო, განსაკუთრებით იშვიათი სიტყვების, კოდის, ემოჯების ან სხვა ენობრივი ენების გამოყენებისას.

როგორ მუშაობს ტოკენიზაცია

მაღალი დონეზე, ტოკენიზაცია მიჰყვება პირდაპირი პროცესს.

ნაბიჯი 1: გაწვდეთ ტექსტი

ტოკენიზატორი აშორებს მხატვრულ ტექსტს იმწარის წესების საფუძველზე.

თანამედროვე LLM-ები ჩვეულებრივ ახერხებენ ქვეცოდნიერების ტოკენიზაციას, არა სრულ სიტყვების ტოკენიზაციას.

ეს მათ საშუალებას აძლევს გაუმკლავდნენ:

  • იშვიათ სიტყვებს
  • შეცდომებს
  • სახელს
  • მრავალენოვან ტექსტს
  • კოდს

ნაბიჯი 2: გარდაქმნას ტოკენები ID-ებად

თითოეული ტოკენი maps-ია მოდელის ლექსიკის შიგნით რიცხვზე.

მაგალითი:

ტოკენიტოკენის ID
ის791
მოდელი4382
მუშაობა2921

მოდელი არასოდეს ხედავს ტექსტს პირდაპირ. მხოლოდ ხედავს ამ რიცხვულ წარმოდგენებს.

ეს არის ხიდი ადამიანის ენასა და ნეირალურ გამოთვლას შორის.

ნაბიჯი 3: ID-ები გარდაქმდეს embedding-ებად

მას შემდეგ რაც ტოკენის ID-ები იქმნება, ისინი გარდაქმნიან ვექტორულ embedding-ებად.

ეს არის ადგილი, სადაც მნიშვნელობა იწყება გამოჩენა.

ამ დროს:

  • მსგავსი ტოკენები ახლოს მდებარეობებში occupy-დებიან ვექტორში
  • იდეებს შორის ურთიერთობები გამზადდება
  • კონტექსტი იწყებს მნიშვნელობას

ტოკენიზაცია ხდება მონაცემების სისტემაში მოხვედრა. Embedding-ები ხდის მას ინტერპრეტირებადთან.

რატომ გახდა ქვეცოდნიერების ტოკენიზაცია სტანდარტი

ძველი NLP სისტემები ხშირად იყოფდნენ ტექსტზე სიტყვებით.

ეს მუშაობდა - ვიდრე მათ ვერ ხედავდნენ სწავლებულ სიტყვებს.

თანამედროვე LLM-ები ჩვეულებრივ იყენებენ მეთოდებს როგორიცაა Byte Pair Encoding (BPE) ან მსგავსი ქვეცოდნიერების სტრატეგიები.

BPE მუშაობს ხშირი ხასიათების დიზაინის მიზნელებზე გაწვდილი შეკვრების ეფექტურად გამომშვენებით. ეს ზრდის კომპრესიას და ლექსიკის ეფექტურობას.

რატომ არის ქვეცოდნიერური მოდელები უკეთესი

მეთოდიმთავარი პრობლემა
სიტყვიერი დონეძალიან ბევრი უცნობი სიტყვები
სიმბოლო დონეძალიან ნელი, ძალიან ხანგრძლივი
ქვეცოდნიერების დონესაუკეთესო ბალანსი მოქნილობის და ეფექტურობის

ეს არის მიზეზი, რის გამოც უმეტეს თანამედროვე მოდელები იყენებენ რაიმე ვერსიას ქვეცოდნიერების ტოკენიზაციის.

რატომ აისახება ტოკენიზაცია ხარჯზე

ამაში ტოკენიზაცია ხდება პრაქტიკული.

უმეტესობა AI API-ები დასატვირთავენ:

  • შესავალი ტოკენების
  • გამომავალი ტოკენების

ეს ნიშნავს რომ ტოკენიზაცია პირდაპირ გავლენას ახდენს ფასზე.

მაგალითად:

შესავალი ტიპიდაახლოებით ტოკენის სიმკვრივე
მარტივი ინგლისურიდაბალი
კოდისაშუალო-აღძვრის
სამართლებრივი ტექსტიმაღალი
ჩინური/იაპონურიხშირად უფრო მაღალი
ემოციური ტექსტიუკვად უმცირესი მაღალი

ორივე პრომპტის იგივე სიმბოლური რაოდენობა შეიძლება ჰქონდეს ძალიან განსხვავებული ტოკენის რიცხვები.

ეს არის ერთ-ერთი გავრცელებული დამალული ხარჯები წარმოებულ AI სისტემებში.

რატომ აისახება ტოკენიზაცია მოდელის ქცევაზე

ტოკენიზაცია ასევე ახსნის ბევრი უცნაურ მოდელის ქცევები.

მაგალითად:

  • რატომ მოდელები უწყვეტად ითვლიან ასოების.
  • რატომ იშვიათ სიტყვები უცნაურად იქცევიან.
  • რატომ ფორმატირების ცვლილებები შეიძლება გავლენა იქონიონ გამოსვლებზე.
  • რატომ გადატანა პრომპტების მნიშვნელობა.

მოდელი არ ფიქრობს ასოებზე ან გრამატიკაზე ისე, როგორც ადამიანები. ის პროგნოზებს ტოკენის სეკვენციას.

ეს განსხვავება ქმნის ბევრ უცნო ქცევას, რასაც მომხმარებლები აღიქვამენ.

კომუნალური განხილვები ხშირად მიუთითებს ტოკენის სტრუქტურაზე, როგორც ერთ-ერთ მიზეზი, რის გამოც მოდელები ვერ ახერხებენ ასოების ადგილობრივი გათვლის.

ტოკენები ხდება შედეგები

მივმართავთ, რომ შევჯერდოთ:

  1. ტოკენები მოდის ტრანსფორმატორში
  2. მოდელი პროგნოზობს შემდეგ ტოკენს
  3. ეს ტოკენი შეიცავს
  4. პროცესით გადის

ეს გაგრძელდება, სანამ:

  • გაჩერდება ტოკენი არ გამოჩნდება
  • ტოკენის შეზღუდვა მიაღწევს
  • სისტემა აჩერებს წარმოქმნას

ეს ნიშნავს რომ AI წარმოქმნა გახლავთ ძირითადი ტოკენ-სატოკური პროგნოზირების ციკლი, არა წინადადების დონეზე მიზეზი.

საბოლოო დასკვნა

ტოკენიზაცია გამოჩენა თითქოს პატარა ტექნიკური დეტალია, მაგრამ ეს ფორმირებს თითქმის ყველაფერს თანამედროვე LLM სისტემებში.

ეს გავლენას ახდენს:

  • ხარჯი
  • სიჩქარე
  • კონტექსტის შეზღუდვები
  • მრავალენოვანი შესრულება
  • მოდელის ქცევა
  • პროდუქციის ხარისხი

თუ ქმნით AI-ით, ტოკენიზაციის გაგება გაწვდას გაცილებით უკეთეს ინტუიციას, რატომ მუშაობენ სისტემები, როგორც ისინი.

ჯერ კიდევ embeddings, transformers, ან შედეგები - აქ არის ტოკენები.

და ყველაფერი იქ იწყება.

ყურადღობით პრომპტების დიზაინი, ლექსიკის არჩეველი, და ტოკენის ბიუჯეტირება დაგეხმარებათ, რომ გაითვალისწინოთ თქვენი ტოკენების გამოყენება და ტოკენების რიცხვები თქვენს ხარჯაპას და ხარისხის მიზნებზე. მიღება - ნაკლები არ მოსალოდნელი დასრულება, დაბალი API ხარჯები, და მოდელები, რომლებიც უკეთ ესმით როგორ წერენ თქვენს მომხმარებლები.

სხვა სტატიების წაკითხვა

იყავით წინ მათზე, ვისაც ყველა აკოპირებს.

ყველას ნახვა
Blog

AI 2040: შეუძლია თუ არა სუპერინტელექტმა 2030 წლამდე მოაღწიოს?

ხელოვნური ინტელიგენცია მოძრაობს სწრაფად, მაგრამ მთავარი კითხვა დღეს უფრო არის AI-ის თავად გასაუმჯობესებლად სისწრაფეა.

Blog

Vera Rubin NVL72: რა არის ახალი თაობის ტრენინგის ინფრასტრუქტურა

Vera Rubin NVL72-ის კომპაქტური ახსნა: რა იცვლება თარო-კონფიგურაციაში, რეალური ოპერაციული ხარჯები, რომლებიც უნდა დაისახოს, და რომელ ორგანიზაციებს უნდა შეიძინონ ან ქირავნონ.

Blog

ადამიან-კომპიუტერის სამუშაო პროცესების განუვითარებლობა: პრაქტიკული UX პარამეტრები გადაცემისთვის, წარმომავლობისა და სანდოობისთვის

ადამიან-კომპიუტერის თანამშრომლობა საუკეთესოა, როდესაც პროდუქტი მოდელს თანაგ მუნდელად ითვლებს, არა როგორც ყოვლისმცოდნე ორაკული.

ვირუსული შაბლონები

გაეცანით ჩვენს ვირუსულ AI შაბლონებს და გამოიყენეთ ისინი თქვენს ფოტოებზე.

შაბლონების დათვალიერება