34-წუთიანი სამუშაო სესია არადეტერმინისტული სისტემების გაზომვაზე: ოქროს მონაცემთა ნაკრების აგება, შემფასებლების არჩევა, რეგრესიების შეკავება CI-ში, პროდაქშენზე დაკვირვება და ციკლის დახურვა გარდრეილებით.
ჩვეულებრივი ფუნქცია ერთსა და იმავე შესატანზე ერთსა და იმავე გამოსავალს აბრუნებს, ამიტომ მწვანე ტესტს აქვს აზრი. LLM-ს არა. იგივე პრომპტი, იგივე პარამეტრები — და მაინც შეიძლება სამი სხვადასხვა პასუხი მიიღოთ: ორი შესანიშნავი და ერთი შეუმჩნევლად მცდარი. შეფასებები არის ის, რაც „დემოზე კარგად ჩანდა“-ს რიცხვად აქცევს — რიცხვად, რომელსაც დაიცავთ, თვალს მიადევნებთ და ზღვრად დააყენებთ.
არადეტერმინიზმი: ერთი შესატანი, რამდენიმე დამაჯერებელი გამოსავალი. შეაფასეთ, კარგია თუ არა განაწილება, და არა ერთი იღბლიანი გაშვება.
გაუშვით ყოველი ქეისი რამდენჯერმე — შეაფასეთ გავლის მაჩვენებელი, და არა ერთი ნიმუში.
შეფასებები შეგრძნებას აქცევს 0-სა და 1-ს შორის ქულად, რომელსაც გრაფიკზე ტრენდად დაინახავთ.
მიზანი: რეგრესია რევიუზე დაბლოკოთ და არა პროდაქშენში აღმოაჩინოთ.
მოდელები, პრომპტები და მონაცემები მუდამ იცვლება — ხარისხს უწყვეტი გაზომვა სჭირდება.
შეფასება ზუსტად იმდენად გულახდილია, რამდენადაც მისი ქეისები. სათამაშო კითხვების ნაკრები, რომელიც თქვენს მაგიდასთან დაწერეთ, სამუდამოდ გაივლის და ვერაფერს გეტყვით. მნიშვნელობა აქვს იმ უხერხულ ქეისებს, რომლებსაც რეალური მომხმარებლები ნამდვილად აგზავნიან — პლუს ყოველი ბაგი, რომელიც უკვე გაასწორეთ, გაყინული ისე, რომ ჩუმად ვეღარასდროს დაბრუნდეს.
ყოველი ქეისი არის შესატანი + მოლოდინი + მეტამონაცემები. შემფასებელი მოდელის გამოსავალს ქულად აქცევს.
დაიწყეთ პატარა და სანდო ნაკრებით. 100 ქეისი, რომელიც ნამდვილად წაიკითხეთ, სჯობს 10,000-ს, რომელიც არა.
ჰგავს რეგრესიული ტესტების ნაკრებს — ყოველი პროდაქშენ-ბაგი მუდმივ ტესტს იმსახურებს, რომ ჩუმად ვეღარასდროს დაბრუნდეს.
ერთადერთი სწორი შემფასებელი არ არსებობს — არსებობს კომპრომისი ღირებულებას, სიჩქარესა და იმას შორის, რამდენ ნიუანსს იჭერთ. იაფი დეტერმინისტული შემოწმებები აშკარას იჭერს; ადამიანის შემოწმება იჭერს იმას, რასაც სხვა ვერაფერი. კარგი სისტემების უმეტესობა რამდენიმეს ერთდროულად იყენებს.
მაქსიმალურად ბევრი შეფასება მარცხნივ გადაიტანეთ; ძვირი მეთოდები შეინახეთ იმისთვის, რასაც ნამდვილად სჭირდება მსჯელობა.
// the output is constrained enough to check directly assert(out.label === "refund") // classification assert(JSON.parse(out)) // valid JSON? assert(out.includes("14 days")) // must contain assert(schema.validate(out).ok) // matches shape
დადებითი — უფასო, მყისიერი, სრულყოფილად გამეორებადი. უარყოფითი — მყიფე ყველაფერზე, რაც თავისუფალი ფორმისაა. როდის იმარჯვებს: ყოველთვის ჯერ ესენი გაუშვით; ყველაზე იაფ ბაგებს ნულოვან ფასად იჭერს.
// similarity & reference metrics — no model needed cosineSim(embed(out), embed(expected)) > 0.8 rouge(out, reference) // overlap for summaries /\$\d+\.\d{2}/.test(out) // a price appears latencyMs < 2000 && costUsd < 0.02 // budgets
დადებითი — იაფი, დეტერმინისტული, იჭერს „დაახლოებით სწორს“. უარყოფითი — ეს მიახლოებები რეალურ ხარისხს სუსტად უკავშირდება. როდის იმარჯვებს: სემანტიკური მსგავსება შესანიშნავი გარდრეილია მანამ, სანამ მსაჯზე დახარჯავთ.
// give the judge a crisp rubric, not "is this good?" const rubric = `Score 1-5. The answer must: - decline to invent a discount - cite the 14-day policy - stay polite. Reply as JSON {score, reason}.` const { score, reason } = await judge(rubric, input, out)
დადებითი — უმკლავდება ნიუანსს, რომელსაც ვერცერთი regex ვერ სწვდება. უარყოფითი — ტოკენები იხარჯება, შეიძლება გადაიხაროს, საკუთარი კალიბრაცია სჭირდება. როდის იმარჯვებს: წყვილებით A/B („რომელი პასუხია უკეთესი?“) უფრო საიმედოა, ვიდრე აბსოლუტური ქულის თხოვნა.
დადებითი — ერთადერთი ნამდვილი ჭეშმარიტება. უარყოფითი — ყოველ PR-ზე არ მასშტაბირდება. როდის იმარჯვებს: დახარჯეთ ნიმუშზე, რომ დაამაგროთ ავტომატური შემფასებლები, რომლებიც დანარჩენ ყველაფერზე ეშვება.
ოფლაინ შეფასებები ოქროს მონაცემთა ნაკრებზე ეშვება გამოშვებამდე — ეს ზღვარია. ონლაინ მეტრიკები რეალურ ტრაფიკს აკვირდება გამოშვების შემდეგ — ეს სიგნალია. ორივე გჭირდებათ: ოფლაინი გეუბნებათ, რა უნდა მოხდეს; ონლაინი — რა ხდება იმ მომხმარებლებთან, რომლებიც არასდროს წარმოგიდგენიათ.
ოფლაინი დეპლოის ზღვარია; ონლაინი რეალობას აკვირდება და ახალ ქეისებს ოქროს ნაკრებში აბრუნებს.
შეფასება, რომელსაც თვეში ერთხელ ხელით უშვებთ, სამეცნიერო პროექტია. შეფასება, რომელიც ყოველ PR-ზე ეშვება და ხარისხის ვარდნისას ბილდს ჩააგდებს, ინჟინერიაა. ჩართეთ ოქროს ნაკრები CI-ში, დააყენეთ ზღვრები საბაზისოსთან შედარებით და მიეცით პაიპლაინს საშუალება, რეგრესიები მერჯამდე დაიჭიროს.
პრომპტის ან მოდელის ყოველი ცვლილება ნაკრებს უშვებს; საბაზისოს ქვემოთ ვარდნა მერჯს ბლოკავს.
ზღვარი დააყენეთ main-თან სხვაობაზე და არა აბსოლუტურ რიცხვზე. „დღევანდელზე უარესი არ იყოს“ უფრო ადვილი დასაცავია, ვიდრე ჯადოსნური 0.92.
შერჩევა ქულებს არყევს. შეფასების გაშვებებისთვის დააფიქსირეთ დაბალი temperature, გაუშვით ყოველი ქეისი N-ჯერ და ზღვარი დააყენეთ მაჩვენებელზე ტოლერანტობის ზოლით — და არა ერთჯერად გავლაზე.
იაფი დეტერმინისტული შემოწმებები ყოველ PR-ზე; მსაჯზე დაფუძნებული სრული ნაკრები ღამით ან რელიზზე. ნუ გადაიხდით მსაჯში ყოველი აკრეფის შეცდომის გასწორებისას.
გამოშვების შემდეგ შეფასების კითხვა ოპერაციული ხდება: რა გააკეთა მოდელმა სინამდვილეში, რომელ შესატანზე, რა ფასად — და განსხვავდება თუ არა დღევანდელი გასული კვირისგან? ეს ნიშნავს ყოველი გამოძახების ტრეისინგს, სრული კონტექსტის ლოგირებას და დრიფტზე თვალის დევნებას.
ტრეისი სპანების ხეა. ყოველი სპანი ატარებს შეყოვნებას, ღირებულებას, ტოკენებს და ზუსტ დატვირთვას — გასათამაშებელს და შესაფასებელს.
აირჩიეთ იმის მიხედვით, სად ცხოვრობთ: ღია კოდის CLI კონტროლისთვის, მართული პლატფორმა თანამშრომლობისა და დეშბორდებისთვის.
აირჩიეთ, როცა გინდათ შეფასებები git-ში და უფასო CI-ზღვარი.
აირჩიეთ, როცა გუნდს სჭირდება საერთო დეშბორდები მრავალ ექსპერიმენტზე.
აირჩიეთ, როცა უკვე LangChain-ის სტეკზე ხართ.
აირჩიეთ მორგებული, კოდზე დაფუძნებული შეფასებებისთვის, რომლებსაც სრულად აკონტროლებთ.
აირჩიეთ იმის მიხედვით, რამდენად გაწყობთ მიბმა: ვენდორ-ნეიტრალური სტანდარტი თუ სპეციალურად LLM-ისთვის აგებული პლატფორმა.
აირჩიეთ, როცა უკვე OTel-ს უშვებთ და გინდათ LLM-ტრეისები დანარჩენი სერვისების იმავე პაიპლაინში.
აირჩიეთ, როცა გინდათ მზა, სრულად აღჭურვილი LLM-დაკვირვებადობა და მისი აგება არ გსურთ.
პირველი ფუნქციონალისთვის პლატფორმა გამოტოვეთ: დაალოგეთ სრული პრომპტი/პასუხის წყვილები იმ მონაცემთა ბაზაში, რომელსაც უკვე უშვებთ, და თვალით გადახედეთ. ტრეისინგის ინსტრუმენტი აიღეთ მაშინ, როცა მრავალნაბიჯიანი ჯაჭვები, რეალური ტრაფიკი ან ერთზე მეტი გამმართველი გეყოლებათ — და არა უფრო ადრე. საუკეთესო ინსტრუმენტი ის არის, რომელსაც თქვენი გუნდი ნამდვილად გახსნის.
შეფასებები საშუალო ხარისხზე გეუბნებათ; გარდრეილები ერთ ცოცხალ მოთხოვნას იცავს. ონლაინ უკუკავშირთან ერთად ისინი ქმნიან ციკლს: დააკვირდით, იპოვეთ ჩავარდნები, დაამატეთ ოქროს ნაკრებში, გაასწორეთ, ხელახლა შეაფასეთ, გამოუშვით. ეს ციკლი არის LLMOps.
ციკლი: პროდაქშენის ჩავარდნები ოქროს ქეისებად იქცევა, შესწორება ხელახლა ფასდება და გამოდის მხოლოდ ის ბილდი, რომელიც რეგრესიას არ იძლევა.
ხუთი სწრაფი კითხვა შეფასებებზე, მონაცემთა ნაკრებებზე, შემფასებლებზე, CI-ზღვარსა და გარდრეილებზე — მყისიერი უკუკავშირი, ავტორიზაციის გარეშე.
ნავიგაცია ← → ღილაკებით ან სქროლით · უკან ბიბლიოთეკაში