ხელოვნურ ინტელექტთან საუბარი ახალ ეტაპზე გადავიდა. Google-მა ბაზარზე ორი ახალი ხმოვანი მოდელი წარადგინა, რომლებიც ხმოვან ასისტენტებში არსებულ მთავარ პრობლემას, დამღლელ შეყოვნებებსა და „მკვდარ პაუზებს“, საბოლოოდ ასრულებს. Gemini 3.8 Live და Gemini 3.8 Live Extended Thinking ქმნიან სტანდარტს, სადაც საუბარი ადამიანური ბუნებრაობით და სრული პარალელური რეჟიმით წარიმართება.
ახალი სერიიდან პირველი მოდელი, Gemini 3.8 Live, მიმართულია მასშტაბურობასა და ხარჯების ოპტიმიზაციაზე. ის აერთიანებს მოქნილ დიალოგს, რეალურ დროში ვიზუალურ დასაბუთებას და 97 ენის ავტომატურ ამოცნობას. სისტემა თავისუფლად გადართავს ენებს საუბრის პროცესში ისე, რომ მომხმარებელმა ტექნიკური ნაკერი ვერ შეამჩნიოს.
ხოლო Gemini 3.8 Live Extended Thinking გამოირჩევა რთული, მრავალეტაპიანი ამოცანების შესრულების უნარით. მან Artificial Analysis-ის Speech-to-Speech ხარისხის ინდექსზე 82.6 ქულით პირველი ადგილი დაიკავა, ხოლო Big Bench Audio ტესტში 97.7 პროცენტი აჩვენა. ეს მოდელი აგენერირებს ღრმა მსჯელობას და პარალელურად აგრძელებს საუბარს.
მთავარი ტექნოლოგიური გარღვევა ასინქრონული ფუნქციების შესრულებაა. როდესაც მომხმარებელი რთულ დავალებას აძლევს, მოდელი აღარ ჩუმდება პასუხის მოლოდინში. ის იყენებს ბუნებრივ ფრაზებს, მაგალითად „მოიცა, გადავამოწებ…“, აგრძელებს ხმის სტრიმინგს და ფონურ რეჟიმში აპლიკაციის პროგრამირების ინტერფეისებსა (API) და ინსტრუმენტებს რთავს.
ინტეგრაცია უკვე ხელმისაწვდომია Gemini API-სა და AI Studio-ს პლატფორმებზე, ხოლო საძიებო სისტემისა და Google Workspace-ის აპლიკაციებში, როგორებიცაა Docs, Gmail და Keep, მომხმარებლებისთვის. უსაფრთხოების მიზნით, ყველა გენერირებული აუდიო ფაილი SynthID ციფრული ნიშნით არის უზრუნველყოფილი. Google-ის ახალი ეკოსისტემა ეყრდნობა ისეთ პარტნიორებს, როგორებიცაა Vercel, Agora, LiveKit და Salesforce.
წყარო: Google blog, SiliconANGLE

