ბუნებრივი ენის დამუშავება 3 წთ კითხვა

წინასწარ მომზადებული დიდი ენის მოდელები

ყველა ჩვენს წინა ამოცანში ჩვენ ვვარჯიშობდით ნერვულ ქსელს გარკვეული ამოცანის შესასრულებლად ეტიკეტირებული მონაცემთა ნაკრების გამოყენებით. დიდი სატრანსფორმატორო მოდელებით, როგორიცაა BERT, ჩვენ ვიყენებთ ენის მოდელირებას თვითმმართველობის ზედამხედველობით, ენის მოდელის შესაქმნელად, რომელიც შემდეგ სპეციალიზირებულია კონკრეტული ქვედა ნაკადის ამოცანებისთვის შემდგომი დომენის სპეციფიკური ტრენინგით. თუმცა, დადასტურდა, რომ მსხვილ ენობრივ მოდელებს ასევე შეუძლიათ მრავალი ამოცანის გადაჭრა ნებისმიერი დომენის სპეციფიკური ტრენინგის გარეშე. მოდელების ოჯახს, რომელსაც შეუძლია ამის გაკეთება, ეწოდება GPT: გენერაციული წინასწარ მომზადებული ტრანსფორმატორი.

სალექციო ვიქტორინა

ტექსტის გენერაცია და გაურკვევლობა

ნერვულ ქსელს შეუძლია ზოგადი დავალებების შესრულება ქვედა დინებაში ტრენინგის გარეშე წარმოდგენილია ენების მოდელები არიან არაზედამხედველობის ქვეშ მყოფი მრავალ დავალების შემსწავლელი ნაშრომში. მთავარი იდეა ის არის, რომ მრავალი სხვა ამოცანის მოდელირება შესაძლებელია ტექსტის გენერირების გამოყენებით, რადგან ტექსტის გაგება არსებითად ნიშნავს მისი წარმოების შესაძლებლობას. იმის გამო, რომ მოდელი მომზადებულია უზარმაზარ ტექსტზე, რომელიც მოიცავს ადამიანურ ცოდნას, ის ასევე ხდება მრავალფეროვანი საგნების მცოდნე.

ტექსტის გაგება და წარმოების უნარი ასევე გულისხმობს რაღაცის ცოდნას ჩვენს გარშემო არსებულ სამყაროზე. ხალხი ასევე სწავლობს დიდწილად კითხვით და GPT ქსელი ამ მხრივ მსგავსია.

ტექსტის გენერირების ქსელები მუშაობს შემდეგი სიტყვის $$P(w_N)$$ ალბათობის პროგნოზირებით, თუმცა, შემდეგი სიტყვის უპირობო ალბათობა უდრის ამ სიტყვის სიხშირეს ტექსტის კორპუსში. GPT-ს შეუძლია მოგვცეს შემდეგი სიტყვის პირობითი ალბათობა წინა სიტყვის გათვალისწინებით: $$P(w_N | w_{n-1}, ..., w_0)$$

თქვენ შეგიძლიათ წაიკითხოთ მეტი ალბათობის შესახებ ჩვენს მონაცემთა მეცნიერება დამწყებთათვის სასწავლო პროგრამა-ში

ენის გენერირების მოდელის ხარისხი შეიძლება განისაზღვროს გაურკვევლობის გამოყენებით. ეს არის შინაგანი მეტრიკა, რომელიც საშუალებას გვაძლევს გავზომოთ მოდელის ხარისხი რაიმე კონკრეტული ამოცანის მონაცემთა ნაკრების გარეშე. იგი ეფუძნება წინადადების ალბათობის ცნებას - მოდელი ანიჭებს დიდ ალბათობას წინადადებას, რომელიც სავარაუდოდ რეალურია (ანუ მოდელი არ არის გაბნეული ამით), და დაბალ ალბათობას წინადადებებს, რომლებსაც ნაკლები აზრი აქვთ (მაგ. რა შეუძლია გააკეთოს?). როდესაც ჩვენ ვაძლევთ ჩვენს მოდელ წინადადებებს რეალური ტექსტის კორპუსიდან, მოველით, რომ მათ ექნებათ მაღალი ალბათობა და დაბალი გაურკვევლობა. მათემატიკურად, ის განისაზღვრება, როგორც ტესტის ნაკრების ნორმალიზებული შებრუნებული ალბათობა: $$ \mathrm{გაურკვევლობა}(W) = \sqrt[N]{1\P(W_1,...,W_N)} $$

შეგიძლიათ ექსპერიმენტი გააკეთოთ ტექსტის გენერირებაზე GPT-ით აღჭურვილი ტექსტური რედაქტორი Hugging Face-დან-ის გამოყენებით. ამ რედაქტორში იწყებთ ტექსტის წერას და [TAB] დაჭერით შემოგთავაზებთ დასრულების რამდენიმე ვარიანტს. თუ ისინი ძალიან მოკლეა, ან არ ხართ კმაყოფილი - კვლავ დააჭირეთ [TAB] და გექნებათ მეტი ვარიანტი, მათ შორის უფრო გრძელი ტექსტი.

GPT არის ოჯახი

GPT არ არის ერთი მოდელი, არამედ მოდელების კოლექცია, რომელიც შემუშავებულია და გაწვრთნილია OpenAI-ის მიერ.

GPT მოდელების მიხედვით, ჩვენ გვაქვს:

GPT-2GPT 3GPT-4
ენის მოდელი 1,5 მილიარდამდე პარამეტრით.ენის მოდელი 175 მილიარდამდე პარამეტრით100T პარამეტრებს და იღებს როგორც გამოსახულების, ისე ტექსტის შეყვანას და ტექსტს.

GPT-3 და GPT-4 მოდელები ხელმისაწვდომია როგორც Microsoft Azure-ის შემეცნებითი სერვისი და როგორც OpenAI API.

სწრაფი ინჟინერია

იმის გამო, რომ GPT გავლილი აქვს ტრენინგი მონაცემთა უზარმაზარ მოცულობებზე ენისა და კოდის გასაგებად, ისინი აწვდიან გამოსავალს შეყვანის (მოთხოვნის) საპასუხოდ. მოთხოვნა არის GPT შეყვანები ან მოთხოვნები, რომლითაც ისინი აწვდიან ინსტრუქციებს მოდელებს იმ ამოცანების შესახებ, რომლებიც მათ შემდეგ დაასრულეს. სასურველი შედეგის მისაღწევად, თქვენ გჭირდებათ ყველაზე ეფექტური მოთხოვნა, რომელიც მოიცავს სწორი სიტყვების, ფორმატების, ფრაზების ან თუნდაც სიმბოლოების არჩევას. ეს მიდგომაა სწრაფი ინჟინერია

ეს დოკუმენტაცია მოგაწვდით დამატებით ინფორმაციას სწრაფი ინჟინერიის შესახებ.

მაგალითი ნოუთბუქი: თამაში OpenAI-GPT-ით

განაგრძეთ სწავლა შემდეგ რვეულებში:

  • ტექსტის გენერირება OpenAI-GPT და Hugging Face Transformers-ით

დასკვნა

ახალი ზოგადი წინასწარ მომზადებული ენობრივი მოდელები არა მხოლოდ ენის სტრუქტურის მოდელირებას ახდენს, არამედ შეიცავს უზარმაზარ რაოდენობას ბუნებრივ ენას. ამრიგად, მათი ეფექტურად გამოყენება შესაძლებელია NLP-ის ზოგიერთი ამოცანის გადასაჭრელად ნულოვანი მაღაზიის ან რამდენიმე დარტყმის პარამეტრებში.

ლექციის შემდგომი ვიქტორინა

ეს გაკვეთილი არის Microsoft “AI for Beginners” კურსის ქართული თარგმანი, გავრცელებული MIT ლიცენზიით.