ბიბლიოთეკა
00/07 · ~32 წთ
GUIDEDECK · გუნდებისთვის, ვინც LLM-ს უშვებს

ფაინთიუნინგი &
მოდელის ადაპტაცია
ისე, რომ არ ინანოთ.

32-წუთიანი სამუშაო სესია მოდელის ქცევის შეცვლაზე — როდის ჯობია პრომპტს მივმართოთ, როდის კმარა მოძიება და როდის ამართლებს წონების ნამდვილად წვრთნა. განვიხილავთ SFT-ს, LoRA-ს, პრეფერენს-ტიუნინგს, დისტილაციას და მათ შორის არსებულ გულახდილ კომპრომისებს.

~32 წთდამწყები → საშუალოვენდორისგან დამოუკიდებელი
გადაახვიეთ
01 · ადაპტაციის კიბე 4 წთ

აიღეთ ყველაზე იაფი საფეხური, რომელიც
პრობლემას წყვეტს — და იქვე გაჩერდით.

„მოდელი ჯერ საკმარისად კარგი არაა“ თითქმის არასდროს ნიშნავს „ფაინთიუნინგი უნდა გავაკეთოთ“. ტექნიკებს კიბე აქვთ, დალაგებული ღირებულებისა და ვალდებულების მიხედვით. ყოველი საფეხური მასზე მაღლა მდგომთან შედარებით გაცილებით იაფია საცდელად, სწრაფია შესაცვლელად და ადვილია უკან დასაბრუნებლად. გუნდების უმეტესობა პასუხს ქვედა ორზე პოულობს.

მოდელის ადაპტაცია — ზოგადი მოდელის იმგვარად მორგება, როგორც თქვენს ამოცანას სჭირდება — სპექტრია და არა ერთი ღილაკი. ერთ ბოლოში მხოლოდ გასაგზავნ სიტყვებს ცვლით (პრომპტი); მეორეში კი — მოდელის წონებს (ფაინთიუნინგი). იმის ცოდნა, სად ცხოვრობს რეალურად თქვენი პრობლემა, კვირებს დაზოგავს.
ფაინთიუნინგი
ბოლო საშუალება
RAG
Few-shot
პრომპტი
იაფი · სწრაფი · შექცევადი
ძვირი · ნელი · შეუქცევადი
ჯერ აქ სცადეთ ↓

ყოველი შემდეგი საფეხური უფრო ძვირია ასაშენებლად და უფრო რთულია შესაცვლელად. ამოწურეთ ქვედები, სანამ აიწევთ.

რას აგვარებს თითოეული საფეხური

  • პრომპტ-ინჟინერია — უფრო მკაფიო ინსტრუქციები, ფორმატი, როლი. აგვარებს „არ აკეთებს იმას, რაც ვთხოვე“ ტიპის პრობლემების უმეტესობას. იხილეთ დეკი →
  • Few-shot მაგალითები — აჩვენეთ პრომპტში 2–5 გარჩეული მაგალითი, რომ მოდელმა შაბლონი გადმოიღოს. ესეც უბრალოდ ტექსტია.
  • RAG — მოიძიეთ ფაქტები შეკითხვის მომენტში და ჩასვით პრომპტში. სწორი საფეხური, როცა ხარვეზი ცოდნაა და არა ქცევა. იხილეთ დეკი →
  • ფაინთიუნინგი — შეცვალეთ წონები. ღირს მუდმივი სტილის, ფორმატის ან ვიწრო უნარისთვის, რომელსაც პრომპტი ვერ იჭერს.
ერთწინადადებიანი ტესტი — თუ ჭკვიანი ახალი კოლეგა ამოცანას სწორად შეასრულებდა თქვენი ინსტრუქციებითა და საჭირო დოკუმენტებით, თქვენ უკეთესი პრომპტი ან RAG გჭირდებათ და არა ფაინთიუნინგი. ფაინთიუნინგი რეფლექსს ასწავლის და არა ფაქტებს აწვდის.
02 · რა არის ფაინთიუნინგი 5 წთ

განაგრძეთ მზა მოდელის წვრთნა
საკუთარ მაგალითებზე.

საბაზო მოდელმა ენა უკვე ისწავლა უზარმაზარი, ზოგადი კორპუსიდან. ფაინთიუნინგი ამ წვრთნას აგრძელებს თქვენი შემავალი → გამომავალი წყვილების პატარა, ფოკუსირებულ ნაკრებზე და წონებს ისე წასწევს, რომ მოდელის ნაგულისხმევი ქცევა თქვენს მაგალითებს მიუახლოვდეს. ყველაზე გავრცელებული ფორმაა supervised fine-tuning.

SFT — Supervised Fine-Tuning — მოდელს აჩვენებს ბევრ (პრომპტი, იდეალური პასუხი) წყვილს და ისე ასწორებს წონებს, რომ მისივე პასუხები იდეალურს მიუახლოვდეს. „supervised“ უბრალოდ ნიშნავს, რომ ყოველ მაგალითს თან ახლავს სასურველი პასუხი. მოდელი კარგი პასუხის ფორმას სწავლობს: ტონს, ფორმატს, სტრუქტურას და იმას, როგორ მოექცეს თქვენს სასაზღვრო შემთხვევებს.
// one line = one labeled example (chat format) {"messages": [ {"role":"system", "content":"You are our support agent."}, {"role":"user", "content":"Where is order #4021?"}, {"role":"assistant", "content":"Order #4021 shipped Apr 2 via UPS…"} ]} // thousands of these → the weights learn your house style

ყოველი მაგალითი წონებში მცირე შესწორებას იწვევს; მთელ ნაკრებზე გამეორებული, მოდელის ნაგულისხმევი ქცევა იცვლება.

კარგად ჯდება

სტილი & ფორმატი

ფიქსირებული ტონი, მკაცრი JSON-ფორმა, დარგის ფრაზეოლოგია — ის, რისი ჩვენებაც 500 მაგალითში უფრო ადვილია, ვიდრე პრომპტში აღწერა.

კარგად ჯდება

ვიწრო უნარი

დააკლასიფიცირეთ სუპორტის ტიკეტები, ამოიღეთ ველები ინვოისებიდან, გადაწერეთ შიდა გაიდლაინებით — გამეორებადი, კარგად განსაზღვრული ამოცანა მკაფიო სწორი პასუხებით.

ცუდად ჯდება

ახალი ფაქტები

წონები წვრთნის დღისთვის გაყინული ცოდნაა. ცვალებადი მონაცემებისთვის (ფასები, დოკუმენტები, დღევანდელი ტიკეტები) მიმართეთ RAG-ს — ფაინთიუნინგი არასაიმედოდ იმახსოვრებს.

03 · მონაცემთა მომზადება 6 წთ

მონაცემთა ნაკრები არის მოდელი.
ნაგავი შედის — ნაგავი გამოდის.

სწორედ ამ ნაწილს აუფასურებენ გუნდები და სწორედ ის წყვეტს წარმატებას. დატიუნებული მოდელი თავისი სასწავლო მაგალითების სარკეა — ყოველი შეუსაბამობა, თითის შეცდომა და ზარმაცი პასუხი ისწავლება და ძლიერდება. დროის უმეტეს ნაწილს აქ დახარჯავთ — და ასეც უნდა იყოს.

ხარისხი სჯობს რაოდენობას. რამდენიმე ასეული სუფთა, თანმიმდევრული და მიზანში მოხვედრილი მაგალითი რეგულარულად სჯობს ათეულ ათასობით ხმაურიანს. მოდელი ვერ არჩევს „კარგ პასუხს“ „პასუხისგან, რომელიც უბრალოდ ფაილში აღმოჩნდა“ — ამიტომ ყოველი მაგალითი ისეთი უნდა იყოს, რომლის გაშვებაც არ შეგრცხვებათ.
ხმაურიანი მონაცემები — არასწორი რეფლექსი
{"prompt":"order status","completion":"it shipped"} {"prompt":"Where's my stuff??","completion":"idk check email"} // inconsistent shape, terse, off-tone, // mixed formats → the model learns the mess
სუფთა მონაცემები — ერთი მკაფიო მიზანი
{"messages":[ {"role":"user","content":"What's the status of order #4021?"}, {"role":"assistant","content":"Order #4021 shipped Apr 2 via UPS, tracking 1Z…"} ]} // same shape every time, full answer, your voice

ყოველთვის გამოყავით შეფასების ნაკრები წვრთნის დაწყებამდე — მხოლოდ ასე გაიგებთ გულახდილად, დაეხმარა თუ არა ტიუნინგი.

მონაცემების ჩეკლისტი

  • თანმიმდევრული ფორმატი — ერთი სქემა, ერთი chat-შაბლონი, ზუსტად ის, რომელსაც ინფერენსის დროს გამოიყენებთ.
  • დაფარეთ კიდეები — ჩართეთ რთული და „თავაზიანად უარის თქმის“ შემთხვევებიც, არა მხოლოდ იდეალური სცენარი.
  • მოაშორეთ დუბლიკატები — თითქმის იდენტური სტრიქონები მოდელს ამრუდებს და ქულებს ბერავს.
  • გამოყავით 10–20% შეფასებისთვის და წვრთნაში არ შეუშვათ — გაჟონვის გარეშე.
  • დააბალანსეთ კლასები — თუ მაგალითების 95% ამბობს „დამტკიცებულია“, მოდელი უბრალოდ ისწავლის, თქვას „დამტკიცებულია“.
საიდან მოდის მაგალითები — ექსპერტების ხელით დაწერილი (ოქრო, მაგრამ ნელი), რეალური ისტორიული ლოგებიდან ამოღებული და დარედაქტირებული, ან სინთეზური: უფრო ძლიერი მოდელი წერს კანდიდატებს, ადამიანები კი არჩევენ. სინთეზური მონაცემები სწრაფად მასშტაბირდება, მაგრამ მასწავლებლის ბრმა ლაქებს იმემკვიდრებს, ამიტომ ადამიანის დასტური მაინც საჭიროა.
04 · პარამეტრ-ეფექტური ტიუნინგი 6 წთ

აწვრთენით პატარა დანამატი,
უკან მდგარი გიგანტი კი გაყინეთ.

სრული ფაინთიუნინგი ყოველ წონას ანახლებს — მილიარდობითს — რაც ნელია, ძვირია და სერიოზულ ტექნიკას მოითხოვს. პარამეტრ-ეფექტური ფაინთიუნინგი (PEFT) ორიგინალ მოდელს აყინავს და მის ნაცვლად ახალი პარამეტრების პატარა ნაკრებს წვრთნის. LoRA ის ტექნიკაა, რომელსაც პირველად და ყველაზე ხშირად შეხვდებით.

LoRA — Low-Rank Adaptation — საბაზო წონებს ხელს არ ახლებს და ორ პატარა მატრიცას სწავლობს, რომელთა ნამრავლიც ემატება შრის გამოსავალს. ეს მატრიცები ძალიან პატარაა (ხშირად მეგაბაიტები და არა გიგაბაიტები), ამიტომ წვრთნა იაფია, შედეგი კი გადასართავი ადაპტერია, რომელსაც საბაზო მოდელს ადებთ ან ხსნით.
from peft import LoraConfig config = LoraConfig( r=8, # adapter rank — keep it small lora_alpha=16, # scaling factor target_modules=["q_proj", "v_proj"], task_type="CAUSAL_LM", ) # base model frozen; only these matrices train
W
გაყინული
A
შედეგი
B
დიდი · უცვლელი
+
პატარა · ნაწვრთნი
=

გამოსავალი = გაყინული W + პატარა დაბალრანგიანი A·B. სწავლობს მხოლოდ A და B.

QLoRA

LoRA კვანტიზებულ ბაზაზე

კვანტიზაცია გაყინულ საბაზო წონებს უფრო დაბალი სიზუსტით ინახავს (მაგალითად, 16 ბიტის ნაცვლად 4 ბიტით) და მეხსიერებას ~4× ამცირებს. QLoRA ჯერ ბაზას აკვანტებს, მერე კი მასზე LoRA-ადაპტერს წვრთნის — სწორედ ასე აკეთებენ დიდი მოდელების ფაინთიუნინგს ერთ GPU-ზე.

ადაპტერები

გადასართავი, დასაწყობებადი, იაფად შესანახი

ერთი საბაზო მოდელი მეხსიერებაში, ბევრი პატარა ადაპტერი დისკზე — სუპორტის ტონის ადაპტერი, იურიდიული ტონის ადაპტერი — რომლებიც მოთხოვნაზე იტვირთება. გაცილებით იაფია, ვიდრე ყოველი გამოყენების შემთხვევისთვის მოდელის სრული ასლის ჰოსტინგი.

ინსტრუმენტების ლანდშაფტი — სად უშვებთ

ჰოსტირებული ფაინთიუნინგი მოდელების ვენდორებისგან

ატვირთეთ JSONL ფაილი, დააჭირეთ წვრთნას, მიიღეთ ენდპოინტი. OpenAI-ის fine-tuning API, Google Vertex AI-ის ტიუნინგი Gemini-სთვის და Claude Haiku-ს ფაინთიუნინგი Amazon Bedrock-ით — ყველა ამ ფორმას მისდევს: პროვაიდერი მალავს GPU-ებსაც და LoRA-ს დეტალებსაც.

დადებითი
ინფრასტრუქტურა საერთოდ არ გჭირდებათ; მომუშავე დატიუნებული ენდპოინტი ნახევარ დღეში, მასშტაბირებაზე კი თქვენს ნაცვლად ზრუნავენ.
უარყოფითი
დახურული წონები, ტოკენზე ფასი, შეზღუდული კონტროლი და მოდელს თან ვერ წაიღებთ.
როდის აირჩიოთ
შედეგი სწრაფად გინდათ, ML-ops-ის ხალხი არ გყავთ და ამ ვენდორთან დარჩენა არ გაწუხებთ.

Hugging Face — PEFT + TRL ღია მოდელებზე

დე-ფაქტო ღია კოდის სტეკი: ბიბლიოთეკები transformers, peft და trl გაძლევთ LoRA-ს, QLoRA-ს, SFT-სა და პრეფერენს-წვრთნას ღიაწონებიან მოდელებზე, რომლებსაც თავად ჰოსტავთ.

დადებითი
სრული კონტროლი, ღია წონები თქვენს საკუთრებაში, ეშვება ყველგან, უზარმაზარი საზოგადოება და მოდელების ჰაბი.
უარყოფითი
წვრთნის კოდს თავად წერთ და თქვენზეა GPU-ები, გამართვა და სერვინგი.
როდის აირჩიოთ
გჭირდებათ საკუთრება, on-prem/პრივატული მონაცემები ან წვრთნის ციკლის მორგება.

Axolotl — ფაინთიუნინგი კონფიგ-ფაილით

Hugging Face-ის სტეკის გარსი, რომელიც წვრთნის გაშვებას ერთ YAML ფაილად აქცევს — მონაცემთა ნაკრები, საბაზო მოდელი, LoRA-ს პარამეტრები — რომ ციკლი ხელით არ დაწეროთ.

დადებითი
გამეორებადი, წაკითხვადი კონფიგები; გონივრული ნაგულისხმევები გავრცელებული რეცეპტებისთვის.
უარყოფითი
ტექნიკა მაინც თქვენია; YAML-აბსტრაქცია მალავს სახელურებს, რომლებიც ოდესღაც შეიძლება დაგჭირდეთ.
როდის აირჩიოთ
გინდათ ღია კოდის კონტროლი ზედმეტი კოდის გარეშე და აფასებთ გამეორებად გაშვებებს.

Unsloth — სწრაფი, მცირემეხსიერებიანი LoRA/QLoRA

ოპტიმიზებული კერნელები, რომლებიც LoRA-სა და QLoRA-ს წვრთნას შესამჩნევად აჩქარებს და მეხსიერებას უმსუბუქებს — ისე, რომ მოკრძალებულ ერთ-GPU-იან სისტემასაც შეუძლია უფრო დიდი მოდელების ფაინთიუნინგი.

დადებითი
დიდი მოგება სიჩქარესა და მეხსიერებაში ერთ GPU-ზე; მეგობრული ნოუთბუქები დასაწყებად.
უარყოფითი
ორიენტირებულია LoRA-ს ტიპის ტიუნინგზე; სრულფასოვანი MLOps პლატფორმა არაა.
როდის აირჩიოთ
GPU-ები გაკლიათ, ექსპერიმენტს ატარებთ ან LoRA-ადაპტერამდე ყველაზე იაფი გზა გინდათ.
05 · პრეფერენს-ტიუნინგი და დისტილაცია 5 წთ

იმიტაციის მიღმა:
ასწავლეთ გემოვნება და დაპატარავეთ მოდელი.

SFT მოდელს ასწავლის, კარგი პასუხები დააკოპიროს. მაგრამ ხშირად ერთი იდეალური პასუხის დაწერა შეუძლებელია — მხოლოდ იმის თქმა შეგიძლიათ, რომ „ეს პასუხი იმაზე უკეთესია“. პრეფერენს-ტიუნინგი სწორედ ამ შედარებებიდან სწავლობს. დისტილაცია სხვა რამეს აკეთებს: დიდი მოდელის უნარს პატარა და იაფ მოდელში კუმშავს.

RLHF & DPO — პრეფერენსის (alignment) ტიუნინგი — მოდელს წვრთნის უპირატესი და უარყოფილი პასუხების წყვილებზე, რომ ისწავლოს, როგორი პასუხი მოსწონთ რეალურად ადამიანებს. RLHF ამას ცალკე reward-მოდელითა და განმტკიცებითი სწავლებით აკეთებს; DPO (Direct Preference Optimization) reward-მოდელს გამოტოვებს და პირდაპირ წყვილებზე ოპტიმიზირებს — უფრო მარტივია და დღეს გავრცელებული საწყისი წერტილია.
// each row: a prompt + a better and worse answer {"prompt": "Explain a deadlock in one sentence.", "chosen": "Two tasks each wait on a lock the other holds, so neither proceeds.", "rejected": "A deadlock is when the computer is bad."} // DPO nudges the model toward 'chosen', away from 'rejected'

მოდელი შედარებიდან სწავლობს და არა ერთი ოქროს პასუხიდან — გამოსადეგია, როცა „უკეთესი“ უფრო ადვილია, ვიდრე „იდეალური“.

დისტილაცია — პატარა მოსწავლე დიდ მასწავლებელს იმეორებს

  • გაუშვით დიდი, ძლიერი მასწავლებელი მოდელი ბევრ პრომპტზე და ჩაიწერეთ მისი პასუხები.
  • შემდეგ SFT-ით დაატიუნეთ პატარა მოსწავლე მოდელი, რომ თქვენს ამოცანაზე იგივე პასუხები გამოსცეს.
  • ცოტა ხარისხს სცვლით მოდელზე, რომლის გაშვებაც პროდაქშენში გაცილებით იაფი და სწრაფია.

მოგება ღირებულებასა და შეყოვნებაშია: ფოკუსირებულ პატარა მოდელს ერთ ვიწრო ამოცანაზე გიგანტის დონე შეუძლია ფასის მცირე ნაწილად.

მოსწავლე სწავლობს მასწავლებლის პასუხების იმიტაციას — იგივე ამოცანა, ღირებულების მცირე ნაწილად.

მიდგომის არჩევა — ღირებულება და სარგებელი

SFT

ყველაზე იაფი წვრთნა

საუკეთესოა, როცა სწორი პასუხი მკაფიოა. სჭირდება ეტიკეტიანი წყვილები. დაიწყეთ აქედან.

LoRA / PEFT

SFT, ოღონდ მსუბუქი

იგივე მიზანი, რაც SFT-ს, გამოთვლითი რესურსის მცირე ნაწილად. ღია მოდელებისთვის ეს ნაგულისხმევი გზაა.

DPO / RLHF

ასწავლის გემოვნებას

სუბიექტური ხარისხისა და ტონისთვის. სჭირდება პრეფერენს-წყვილები; DPO უფრო მარტივი გზაა.

დისტილაცია

დაპატარავება პროდაქშენისთვის

შეამცირეთ ღირებულება/შეყოვნება მას შემდეგ, რაც ხარისხი დადასტურდება. დაგჭირდებათ ძლიერი მასწავლებელი და ბევრი პრომპტი.

06 · შეფასება და დეპლოი 4 წთ

დაამტკიცეთ, რომ უკეთესია, სანამ
გაუშვებთ.

დატიუნებული მოდელი, რომელიც რამდენიმე ხელით ტესტში უკეთესი გეჩვენებათ, ჯერ შედეგი არაა. გჭირდებათ ციფრები — მონაცემებზე, რომლებიც მოდელს არასდროს უნახავს, და იმ მარტივ საბაზისო ვარიანტთან შედარებით, რომლის გადალახვასაც ცდილობდით. თუ ის მკაფიოდ არ იმარჯვებს, საბაზისო ვარიანტი გაუშვით — მისი გაშვება და მოვლა უფრო იაფია.

გულახდილი შედარება — ყოველთვის შეაფასეთ დატიუნებული მოდელი საბაზისო ვარიანტთან (კარგად დაპრომპტული საბაზო მოდელი ან ბაზა + RAG) შედარებით, გამოყოფილ საშეფასებო ნაკრებზე. კითხვა არასდროსაა „კარგია თუ არა ტიუნინგი?“ — კითხვაა „საკმარისად უკეთესია იმისთვის, რომ ღირებულება გაამართლოს?“ შეფასება თავისთავად მთელი დისციპლინაა. იხილეთ LLM Evals დეკი →
// the cardinal rule: never score on training data
const [train, holdout] = split(dataset, { evalFrac: 0.15 })

const baseline = await evaluate(baseModel,  holdout)
const tuned    = await evaluate(tunedModel, holdout)

if (tuned.score <= baseline.score) throw new Error("ship base")
if (tuned.regressions !== 0)       throw new Error("skills lost")

ერთი და იგივე გამოყოფილი შეკითხვები ორივე მოდელში; გაუშვით მხოლოდ აშკარა გამარჯვებული.

ყურადღება

კატასტროფული დავიწყება

ვიწრო ნაკრებზე გადაჭარბებულმა ტიუნინგმა შეიძლება წაშალოს ზოგადი უნარები, რომლებიც მოდელს ადრე ჰქონდა. დაიტოვეთ შეფასების ნაკრებში რამდენიმე ფართო შემოწმება, რომ ეს დაიჭიროთ.

ყურადღება

გადაწვრთნა

თუ საწვრთნელ მაგალითებზე ბრწყინავს, გამოყოფილ ნაკრებზე კი ვარდება, მან დაიმახსოვრა და არა ისწავლა. ნაკლები ეპოქა ან უფრო მრავალფეროვანი მონაცემები.

დეპლოი

ვერსიონირება & მონიტორინგი

დაატეგეთ მოდელი + მონაცემთა ნაკრები + კონფიგურაცია, დაადეპლოეთ ადაპტერი თქვენი ენდპოინტის უკან და განაგრძეთ ცოცხალი ხარისხის დაკვირვება — განაწილებები იცვლება.

07 · როდის არ დავატიუნოთ და შეჯამება 2 წთ

საუკეთესო ფაინთიუნინგი ხშირად ის არის,
რომელსაც არ აკეთებთ.

ფაინთიუნინგი რეალური ვალდებულებაა: მოსავლელი მონაცემთა პაიპლაინი, სახოსტავი მოდელი და ხელახალი წვრთნა ყოველ ჯერზე, როცა საბაზო მოდელი თქვენს ქვეშ უმჯობესდება. მიმართეთ მას ბოლოს და მხოლოდ მაშინ, როცა იაფი საფეხურები ნამდვილად აღარ კმარა.

არ ღირს

…ახალი ცოდნის დასამატებლად

ცვალებადი ფაქტების ადგილი RAG-ია და არა გაყინული წონები. ფაინთიუნინგი არასაიმედოდ იმახსოვრებს და მყისვე ძველდება.

არ ღირს

…პრომპტის გამოცდამდე

„ცუდი პასუხების“ უმეტესობა პრომპტის პრობლემაა. უფრო მკაფიო პრომპტი ან რამდენიმე მაგალითი უფასო და შექცევადია — ფაინთიუნინგი კი არც ერთი და არც მეორე.

არ ღირს

…მწირი ან არეული მონაცემებით

ძალიან ცოტა ან ხმაურიანი მაგალითი მოდელს აუარესებს. მონაცემთა ნაკრები არაა — ფაინთიუნინგიც არაა; ჯერ მონაცემები მოაწესრიგეთ.

1ჯერ ყველაზე იაფ საფეხურზე ავიდეთ. პრომპტი → few-shot → RAG → ფაინთიუნინგი. გაჩერდით იმ წამსვე, როცა პრობლემა მოგვარდება.
2ფაინთიუნინგი ქცევისთვის, RAG ცოდნისთვის. წონები ასწავლის სტილსა და უნარს; მოძიება ახალ ფაქტებს აწვდის.
3მონაცემთა ნაკრები არის მოდელი. რამდენიმე ასეული სუფთა, თანმიმდევრული მაგალითი სჯობს ხმაურიანთა გროვას.
4ნაგულისხმევად გამოიყენეთ LoRA/PEFT. პაწია გადასართავი ადაპტერები სარგებლის უდიდეს ნაწილს ღირებულების მცირე ნაწილად იძლევა.
5დაამტკიცეთ გამოყოფილ მონაცემებზე. გაზომვადად აჯობეთ საბაზისო ვარიანტს, ან თავად ის გაუშვით.
  • არასწორი ფაქტები ან მოძველებული ინფორმაცია? → RAG და არა ფაინთიუნინგი.
  • არასწორი ფორმატი, ტონი ან ვიწრო, გამეორებადი უნარი? → SFT / LoRA.
  • „უკეთესი“ გემოვნების საკითხია და მხოლოდ შედარება შეგიძლიათ? → DPO.
  • ხარისხი კარგია, მაგრამ ძალიან ნელი/ძვირია? → დისტილაცია.
  • დარწმუნებული არ ხართ? → ჯერ პრომპტი გააუმჯობესეთ და გაზომეთ. ეს უფასოა.
ცოდნის შემოწმება

დაგამახსოვრდათ?

ხუთი სწრაფი შეკითხვა ადაპტაციის კიბეზე, SFT-ზე, მონაცემებზე, LoRA-ზე და იმაზე, როდის უნდა გაჩერდეთ — მყისიერი უკუკავშირი, ავტორიზაციის გარეშე.

შეაფასეთ ეს დასტა
იყავით პირველი

ნავიგაცია ← → ღილაკებით ან სქროლით · უკან ბიბლიოთეკაში