ხმოვანი აგენტების ძველი, მოუქნელი ჯაჭვი – სადაც მეტყველების ამოცნობა (STT), ტექსტის დამუშავება (LLM) და ხმის სინთეზი (TTS) ცალ-ცალკე ოპერირებდა – წარსულს ჩაბარდა. 2026 წლის 10 სექტემბერს OpenAI-მ API-ში GPT-Live-1 გაუშვა. ეს არის სრული დუპლექსის (full-duplex) მოდელი, რომელსაც ერთდროულად შეუძლია ადამიანის მოსმენა და საუბარი. სისტემა ბუნებრივად ამუშავებს რეპლიკის გაწყვეტას, პაუზებსა და ფონურ ხმაურს. მთავარი გარღვევა კი ხარჯებსა და ლოგიკაშია: ერთი წუთის ფასი გაშვებისას ზუსტად $0.05-ია, წამობრივი დათვლით.
აქამდე ხმოვანი ასისტენტები რთულ დილემას წყვეტდნენ: ან ირჩევდი სწრაფ, მაგრამ შეზღუდულ მოდელს, ან მძლავრ სისტემას, რომელიც პასუხის გაცემას წამებს ანდომებდა. GPT-Live-1 ამ ბარიერს შლის. მოდელი თავად მართავს რეალურ აუდიონაკადს, ხოლო ღრმააზროვან აზროვნებასა და ხელსაწყოების გამოძახებას ცალკე ბექენდ-მოდელებს, მაგალითად GPT-6 Astra-სა და Codex-ის სპეციალურ სისტემებს ანდობს. ამ გზით ბექენდის ხარჯი და გამოთვლითი სიმძლავრე ხმოვანი ინტერფეისისგან სრულად გამიჯნულია.
დეველოპერებისთვის ინტეგრაცია მაქსიმალურად მოქნილია. API-ს აქვს WebRTC-ის, WebSockets-ისა და ტელეფონიის სრული მხარდაჭერა. სისტემას თან ახლავს ზუსტი ტრანსკრიფცია, საკვანძო სიტყვების პრიორიტეტიზაცია (keyword biasing) და რეპლიკის დასრულების ზუსტი დეტექცია.
ტექნიკური ნახტომი ციფრებშიც ნათლად ჩანს. OpenAI-ის განცხადებით, GPT-Realtime-2.1-თან შედარებით ახალი მოდელი Full Duplex Bench-ის ტესტში დაახლოებით 30 პროცენტული პუნქტით უკეთეს შედეგს აჩვენებს. საზოგადოების დამოუკიდებელი გაზომვებით, დაყოვნების დრო (latency) 1.41 წამიდან 0.798 წამამდე შემცირდა. ეს ის ზღვარია, როცა კომპიუტერთან ინტერაქცია ცოცხალი საუბრისგან თითქმის აღარ განსხვავდება.
პრაქტიკული შედეგები უკვე შთამბეჭდავია. Speak-ის პარალელური შეფასებით, მოსაუბრისთვის ადგილზე ჩაჭრისა და საუბრის გაწყვეტის შემთხვევები დაახლოებით 80%-ით შემცირდა. კიდევ უფრო მასშტაბური აღმოჩნდა საინჟინრო ეფექტი HealthReach-ისთვის: კომპანიამ კოდის ბაზა 80%-ით შეამცირა და სისტემიდან 23 000 ხაზზე მეტი ზედმეტი კოდი ამოიღო.
OpenAI-ის ეს ნაბიჯი ხმოვანი ინტერფეისების მშენებლობას ფუნდამენტურად ცვლის. რთული მრავალკომპონენტიანი ინფრასტრუქტურის ახმოვანი აგენტების ძველი, მოუქნელი ჯაჭვი – სადაც მეტყველების ამოცნობა (STT), ტექსტის დამუშავება (LLM) და ხმის სინთეზი (TTS) ცალ-ცალკე ოპერირებდა – წარსულს ჩაბარდა. 2026 წლის 10 სექტემბერს OpenAI-მ API-ში GPT-Live-1 გაუშვა. ეს არის სრული დუპლექსის (full-duplex) მოდელი, რომელსაც ერთდროულად შეუძლია ადამიანის მოსმენა და საუბარი. სისტემა ბუნებრივად ამუშავებს რეპლიკის გაწყვეტას, პაუზებსა და ფონურ ხმაურს. მთავარი გარღვევა ხარჯებსა და ლოგიკაშია: მისი ფასი წუთში ზუსტად $0.05-ია, წამობრივი დათვლით.
აქამდე ხმოვანი ასისტენტები რთულ დილემას წყვეტდნენ: ან ირჩევდი სწრაფ, მაგრამ შეზღუდულ მოდელს, ან მძლავრ სისტემას, რომელიც პასუხის გაცემას წამებს ანდომებდა. GPT-Live-1 ამ ბარიერს ხსნის. მოდელი თავად მართავს რეალურ აუდიო ნაკადს, ხოლო ღრმააზროვნებასა და ხელსაწყოების გამოძახებას ცალკე ბექენდ-მოდელებს, მაგალითად GPT-6 Astra-სა და Codex-ის შესაბამის სისტემებს ანდობს. ამ გზით ბექენდის ხარჯი და გამოთვლითი სიმძლავრე ხმოვანი ინტერფეისისგან სრულად გამიჯნულია.
დეველოპერებისთვის ინტეგრაცია მაქსიმალურად მოქნილია. API-ს აქვს WebRTC-ის, WebSockets-ისა და ტელეფონიის სრული მხარდაჭერა. სისტემას თან ახლავს ზუსტი ტრანსკრიფცია, საკვანძო სიტყვების პრიორიტეტიზაცია (keyword biasing) და რეპლიკის დასრულების ზუსტი დეტექცია.
ტექნიკური ნახტომი ციფრებშიც თვალნათლივ ჩანს. OpenAI-ის განცხადებით, GPT-Realtime-2.1-თან შედარებით ახალი მოდელი Full Duplex Bench-ის ტესტში დაახლოებით 30 პროცენტული პუნქტით უკეთეს შედეგს აჩვენებს. საზოგადოების დამოუკიდებელი გაზომვებით, დაყოვნების დრო (latency) 1.41 წამიდან 0.798 წამამდე შემცირდა. ეს ის ზღვარია, როცა კომპიუტერული იმიტაცია ცოცხალი საუბრისგან თითქმის აღარ განხვავდება.
პრაქტიკული შედეგები უკვე შთამბეჭდავია. Speak-ის პარალელური შეფასებით, მოსაუბრისთვის ადგილზე ჩაჭრისა და საუბრის გაწყვეტის შემთხვევები დაახლოებით 80%-ით შემცირდა. კიდევ უფრო მასშტაბური აღმოჩნდა საინჟინრო ეფექტი HealthReach-ისთვის: კომპანიამ კოდის ბაზა 80%-ით შეამცირა და სისტემიდან 23 000 ხაზზე მეტი კოდი ამოიღო.
OpenAI-ის ეს ნაბიჯი ხმოვანი ინტერფეისების მშენებლობას ფუნდამენტურად ცვლის. რთული მრავალკომპონენტიანი ნაგებობის აწყობა და შენარჩუნება დეველოპერებისთვის აღარ წარმოადგენს აუცილებლობას. ამავე დროს, იხსნება გზა სრულფასოვანი ვირტუალური პარტნიორებისა და დამხმარეების შესაქმნელად, რომლებიც ადამიანურ რიტმში, შეფერხებების გარეშე საუბრობენ.
წყარო: Build more natural voice experiences with GPT-Live-1 in the API (OpenAI, Sep 10, 2026), Introducing GPT-Live-1 in the API (OpenAI Developer Community), Delegation and tools in GPT-Live (OpenAI API docs)

