34-წუთიანი სამუშაო სესია სერვისებზე, რომლებიც მოდელებს უმასპინძლებენ, და მათ გარშემო არსებულ ინფრასტრუქტურაზე — AWS Bedrock, Google Vertex AI, Azure AI Foundry, მოდელების გეითვეები, აგენტების რანტაიმები — და გულახდილი არჩევანი ჰოსტირებულ API-სა და მოდელს შორის, რომელსაც თავად უშვებთ.
ხუთი წლის წინ „AI-ის გამოყენება“ ნიშნავდა GPU-ების ყიდვას, CUDA-სთან ჭიდილს და ადამიანების აყვანას, რომ მოდელის სერვერი ღამის 3 საათზეც ცოცხალი ყოფილიყო. დღეს გუნდების უმეტესობა API-ს იძახებს და უშვებს. მართული AI პლატფორმა სწორედ ის სერვისია, რაც ამას შესაძლებელს ხდის — და პირველი ნამდვილი გადაწყვეტილება ისაა, სტეკის რა ნაწილის ფლობა გინდათ სინამდვილეში.
მართული პლატფორმები ოპერაციების ხუთ შრეს ერთ ანგარიშად კუმშავს — თქვენ მხოლოდ აპლიკაცია და პრომპტები გრჩებათ.
თითოეული ჰიპერსკეილერის მთავარ პროდუქტს ერთი და იგივე ფორმა აქვს: ერთი API საბაზისო მოდელების კატალოგის წინ, მართვით, ლოგირებითა და ბილინგით, ჩაშენებული იმ ღრუბელში, რომელსაც უკვე იყენებთ. ისინი ყველაზე მეტად იმით განსხვავდებიან, რომელ მოდელებს აჩენენ წინ და რომელ ღრუბელზე გაქორწინებენ.
modelId-ს და ტექსტს აგზავნით. პლატფორმა მარშრუტიზაციას, მასშტაბირებასა და ანგარიშს იღებს თავზე.პლატფორმა კომუტატორია: თქვენი აპი ერთ API-ზე ლაპარაკობს; modelId-ს მიღმა მდგარი მოდელი კი გადაწერის გარეშე იცვლება.
modelId-ის შეცვლა მარტივია; ცოდნის ბაზის ან დამცავი ბარიერის ამოხსნა კი ის ღირებულებაა, რაც გაკავებთ.import { BedrockRuntimeClient, ConverseCommand } from "@aws-sdk/client-bedrock-runtime" const client = new BedrockRuntimeClient({}) const out = await client.send(new ConverseCommand({ modelId: MODEL, // swap providers — same call messages: [{ role: "user", content: [{ text: "Summarize Q3" }] }], })) console.log(out.output?.message?.content?.[0]?.text)
Bedrock-ის Converse API მოთხოვნას ანორმალიზებს — შეცვალეთ MODEL და კოდის დანარჩენი ნაწილი ხელუხლებელი რჩება.
სერვერლეს წვდომა Anthropic-ის (Claude), Meta-ს, Mistral-ის, Cohere-ის, AI21-ის, Stability-ის და Amazon-ის საკუთარი Nova-სა და Titan-ის მოდელებზე — პლუს Knowledge Bases (RAG), Guardrails, მოდელის შეფასება და Bedrock Agents, ყველაფერი IAM-ის მიღმა.
Google Cloud-ის ერთიანი AI-ზედაპირი. Model Garden Gemini-ს მესამე მხარის მოდელებთან (Claude, Llama, Mistral) ერთად აჩენს წინ, და იგივე პლატფორმა ასევე აკეთებს საკუთარ წვრთნას, პაიპლაინებსა და Agent Builder-ის სტეკს — უფრო მეტ სიგანეს, ვიდრე სუფთა მოდელის გეითვეი.
Microsoft-ის პლატფორმა (ადრე Azure AI Studio) კორპორაციულ წვდომას აძლევს OpenAI-ის GPT-მოდელებზე Azure OpenAI-ის გავლით, პლუს მოდელების კატალოგს (Llama, Mistral და სხვები), აგენტების სერვისს, prompt flow-ს, შეფასებებსა და Content Safety-ს — ყველაფერი Azure-ის იდენტობისა და შესაბამისობის ქვეშ.
ზოგჯერ მოდელი, რომელიც გჭირდებათ, ჯერ არ არსებობს — თაღლითობის დეტექტორი თქვენს ტრანზაქციებზე, მოთხოვნის პროგნოზირება, კლასიფიკატორი თქვენი დარგის ჟარგონზე. ამისთვის სრული ML-პლატფორმა გინდათ: SageMaker AWS-ზე, Vertex AI Google-ზე. ისინი მთელ სასიცოცხლო ციკლს მართავს და არა მხოლოდ ინფერენსს.
პლატფორმა ყველა ეტაპსა და უკუკავშირის ციკლს მართავს — როცა ცოცხალი სიზუსტე იკლებს, მოდელს ხელახლა წვრთნით და ხელახლა უშვებთ.
// you own data, training, eval, serving const est = new XGBoost({ instanceType: "ml.m5", ... }) await est.fit(trainData) // managed job const model = await est.register() // versioned await model.deploy(endpoint) // real-time // worth it for tabular / domain-specific tasks
// no training, no servers — instant const out = await client.send(new ConverseCommand({ modelId: MODEL, messages: msgs, })) // great for language, summary, extraction, // classification with a good prompt
მოდელის გამოძახება „მარტივია“, და არა „ნაკლებფასი“. სრულ პლატფორმას მაშინ მიმართეთ, როცა არცერთი მზა მოდელი არ უხდება თქვენს მონაცემებს — კლასიკური ცხრილური ამოცანებისთვის პატარა დაწვრთნილი მოდელი ხშირად სჯობს გიგანტურ LLM-ს ღირებულებითა და შეყოვნებით. არსებული მოდელის თავიდან წვრთნის ნაცვლად მის ადაპტაციაზე იხილეთ ფაინთიუნინგი.
ღრუბლოვანი პლატფორმები ერთ ღრუბელზე გაბამთ. მოდელის გეითვეი უფრო თხელი, პროვაიდერისგან ნეიტრალური შრეა: ერთი ენდპოინტი, რომელიც თანაბრად მიმართავს OpenAI-ზე, Anthropic-ზე, Google-ზე და ღია მოდელებზე — სარეზერვო გადართვით, ხარჯის აღრიცხვითა და ერთი API-გასაღებით ყველასთვის.
ერთი გასაღები, ერთი ენდპოინტი. გეითვეი ძირითად მოდელს აგზავნის და სარეზერვოზე გადადის, თუ ის შეცდომას ან სიხშირის ლიმიტს დააბრუნებს.
import { generateText } from "ai" const { text } = await generateText({ model: "anthropic/claude-...", // creator/model slug prompt, }) // change "openai/gpt-..." → new provider, same code // the gateway resolves auth, routing + failover
პროვაიდერებს შორის მხოლოდ creator/model სლაგი იცვლება — დანარჩენს გეითვეი აგვარებს.
გირჩევნიათ გეითვეის თვითჰოსტინგი? LiteLLM პოპულარული ღია კოდის პროქსია, რომელიც პროვაიდერებზე იმავე OpenAI-სთან თავსებად API-ზე ლაპარაკობს — იგივე იდეა, ოღონდ თქვენ უშვებთ.
ამ სივრცის ყველაზე მკვეთრი კომპრომისი: გამოიძახოთ საკუთრებაში არსებული მოდელი (Claude, GPT, Gemini) ქსელით, თუ გაუშვათ ღიაწონებიანი მოდელი (Llama, Mistral) აპარატურაზე, რომელსაც აკონტროლებთ. ორივე ლეგიტიმურია. გულახდილი პასუხი დამოკიდებულია ხარჯის ფორმაზე, მონაცემების წესებზე და იმაზე, რამდენ ოპერაციულ ტვირთს აიტანთ.
ჰოსტინგი: მონაცემი გადის, იხდით ტოკენზე, არაფერს უშვებთ. ლოკალური: მონაცემი რჩება, იხდით ყუთში, დატვირთულია ის თუ უქმად დგას.
ღია მოდელების პროდაქშენში გაშვება ცალკე დისციპლინაა — სერვინგი, ავტომასშტაბირება და მონიტორინგი აღწერილია დეკში MLOps. გუნდების უმეტესობისთვის: დაიწყეთ ჰოსტინგით და თვითჰოსტინგზე მხოლოდ მაშინ გადადით, როცა ხარჯი ან შესაბამისობა გაიძულებთ.
აგენტი მოდელს ციკლში ახვევს: ის მსჯელობს, ინსტრუმენტებს იძახებს, შედეგებს კითხულობს და იმეორებს, სანამ ამოცანა არ დასრულდება. ღრუბლები ახლა უკვე მართულ რანტაიმებს გვთავაზობენ, რომ ციკლი, მეხსიერება და ინსტრუმენტების შეერთება ხელით არ დაწეროთ. ღრმა ჩაძირვა დეკშია AI აგენტები & ინსტრუმენტები — აქ პლატფორმებს ვხატავთ რუკაზე.
ციკლი რანტაიმს ეკუთვნის — ის იძახებს ინსტრუმენტებს, მეხსიერებას ატარებს და მოდელს ხელახლა ეკითხება, სანამ მიზანი არ მიიღწევა.
Vertex AI Agent Builder Google-ის მართული აგენტური სტეკია. აგებთ ღია კოდის Agent Development Kit-ით (ADK), შემდეგ კი დეპლოით მართულ რანტაიმზე (Agent Engine), რომელიც სესიებს, მასშტაბირებასა და ტრეისინგს უვლის — აგენტები, რომლებიც Gemini-სა და თქვენს ინსტრუმენტებს ეყრდნობა.
A2A (Agent2Agent) ღია პროტოკოლია — ახლა უკვე Linux Foundation-ის ქვეშ — რომლითაც სხვადასხვა გუნდის ან ვენდორის მიერ აგებული აგენტები ერთმანეთს აღმოაჩენენ და თანამშრომლობენ. ეს თავსებადობის შრეა: სადაც MCP ასტანდარტებს, როგორ მიდის აგენტი ინსტრუმენტებამდე, A2A ასტანდარტებს, როგორ მიდის აგენტი სხვა აგენტებამდე.
Bedrock Agents საბაზისო მოდელს აერთებს ქმედებების ჯგუფებთან (თქვენი ფუნქციები, ჩვეულებრივ AWS Lambda) და Knowledge Bases-თან (მართული RAG), ასე რომ მოდელს ნამდვილი ნაბიჯების გადადგმა და პასუხების თქვენს მონაცემებზე დაფუძნება შეუძლია — ყველაფერი AWS-ის IAM-ისა და ლოგირების შიგნით. AWS ასევე გთავაზობთ AgentCore-ს, უფრო ახალ მართულ რანტაიმს აგენტების დასადეპლოებლად (მათ შორის სხვა ფრეიმვორკებით აგებულების), მეხსიერებით, იდენტობითა და დაკვირვებადობით.
ერთი აგენტისთვის რამდენიმე ინსტრუმენტით ჩვეულებრივი ციკლი თქვენსავე კოდში (ან მსუბუქი ფრეიმვორკი) ხშირად საკმარისია — იხილეთ AI აგენტები & ინსტრუმენტები. მართულ პლატფორმას მაშინ მიმართეთ, როცა გჭირდებათ მდგრადი სესიები, მრავალაგენტიანი კოორდინაცია, ინსტრუმენტების იზოლირებული შესრულება ან კორპორაციული დონის ტრეისინგი და იდენტობა. ერთჯერადი პრომპტისთვის მძიმე რანტაიმი არ აიღოთ.
ჩამოაცილეთ ბრენდების სახელები და თითქმის ყოველი არჩევანი ოთხ კითხვამდე დადის: რა ღირს, სად შეიძლება მონაცემები ცხოვრობდეს, რამდენად სწრაფად უნდა პასუხობდეს და რამდენად ძნელია წასვლა.
ხტუნვადი ან დაბალი მოცულობა → ტოკენზე გადახდადი ჰოსტინგი. მაღალი, სტაბილური მოცულობა → თვითჰოსტინგმა შეიძლება მოიგოს ერთეულის ღირებულებით. დაამოდელეთ ნამდვილი ტრაფიკი და არა დემო.
რეგულირებული ან ქსელისგან იზოლირებული მონაცემები → ინფერენსი თქვენს საზღვრებში დატოვეთ (ღრუბლოვანი პლატფორმა თქვენს რეგიონში ან ლოკალურად). ჯერ შეამოწმეთ შენახვისა და რეგიონის პირობები.
შეკრიბეთ ნახტომები: გეითვეები და აგენტების ციკლები მილიწამებს ღირს. მჭიდრო, ინტერაქტიული გზებისთვის მოდელი აპლიკაციის გვერდით განათავსეთ.
მოდელის შეცვლა იაფია; ცოდნის ბაზების, დამცავი ბარიერებისა და აგენტების რანტაიმების ამოხსნა — არა. გეითვეი რისკს ამცირებს; პლატფორმის ღრმა ფუნქციონალი კი გაბამთ.
უხეში გზაა და არა კანონი: მონაცემების წესები და მოცულობა ჰოსტინგის ნაგულისხმევი გზიდან გწევთ; ბევრი პროვაიდერის საჭიროება კი გეითვეის ამატებს.
modelId ან სლაგი უნდა იცვლებოდეს.ხუთი სწრაფი კითხვა მართულ პლატფორმებზე, გეითვეებზე, ჰოსტინგსა და ლოკალზე და აგენტებზე — მყისიერი უკუკავშირი, ავტორიზაციის გარეშე.
ნავიგაცია ← → ღილაკებით ან სქროლით · უკან ბიბლიოთეკაში