ოთხ, 16 სექ, 2026
ახალი ინტერაქტიული ქვიზები დაემატა საიტს — შეამოწმე შენი ცოდნა. ნახვა →
ხელოვნური ინტელექტი და მანქანური სწავლება

OpenAI-მ GPT-6 Astra გამოუშვა და გრეგ ბროკმანმა AGI-ს ეპოქაზე განაცხადა

OpenAI-მ ოფიციალურად წარადგინა თავისი ახალი ფლაგმანი მოდელი GPT-6 Astra, რომლის გამოშვებასაც თან ახლავს Daybreak ეტაპობრივი გამოშვების სტრატეგია და კრიტიკული კიბერუსაფრთხოების სრულიად ახალი...

OpenAI-მ ოფიციალურად წარადგინა თავისი ახალი ფლაგმანი მოდელი GPT-6 Astra, რომლის გამოშვებასაც თან ახლავს Daybreak ეტაპობრივი გამოშვების სტრატეგია და კრიტიკული კიბერუსაფრთხოების სრულიად ახალი დონე. გრეგ ბროკმანმა ხელოვნური ინტელექტის ერის მიმდინარე გამოწვევებზე ვრცლად ისაუბრა და ხაზი გაუსვა უსაფრთხოების აუცილებლობას, თუმცა ბაზრის რეალური სურათის დასანახად ტექნოლოგიურმა საზოგადოებამ და კორპორატიულმა ინვესტორებმა ყურადღება დამოუკიდებელ ბენჩმარკებზე გადაიტანეს. ეს ტრენდი სრულიად ბუნებრივია, რადგან ინდუსტრიას კონკრეტული და გაზომვადი შედეგები სჭირდება.

ქვემოთ მოცემულ ვიდეოში შეგიძლიათ იხილოთ OpenAI-ს ოფიციალური სარეკლამო რგოლი, რომელიც ახალი სისტემის მთავარ შესაძლებლობებს აღწერს.

სანამ დამოუკიდებელ ტესტებზე გადავალთ, აუცილებელია განვიხილოთ OpenAI-ს საკუთარი ცხრილი და მწარმოებლის ციფრები, რომლებიც პირველ რიგში მაქსიმალურ ტექნიკურ წარმადობაზეა ფოკუსირებული. კომპანიის ოფიციალური ბენჩმარკები ნამდვილად შთამბეჭდავად გამოიყურება. OSWorld 2.0 offline subset ტესტში ახალმა მოდელმა 72.6% დააფიქსირა და დავალების შესრულებას დაახლოებით 40 წუთი მოანდომა, მაშინ როცა წინა თაობის GPT-5.6 Sol-ის მაჩვენებელი 65.7% იყო და პროცესს 75 წუთი სჭირდებოდა. სხვა ტექნიკური მიმართულებებით კომპანიის ციფრები ასეთია: ურთულეს FrontierMath Tier 4 v2 ბენჩმარკზე მოდელმა 97.6% მიიღო, DeepSWE v1.1 ტესტში შედეგი 74.1%-ია, ხოლო BenchCAD სისტემაში 95.9% დაფიქსირდა.

ამას გარდა, ყურადღებას იქცევს ახალი დამატებული მონაცემებიც. პირველ რიგში, Agents’ Last Exam ტესტში Astra 59.3%-ს აჩვენებს, რითაც სტაბილურად უსწრებს Sol-ის 52.7%-იან შედეგს. კიდევ უფრო მასშტაბური სხვაობა გვაქვს AutomationBench სისტემაში, სადაც მოდელმა 41.4% მიიღო. შესადარებლად, Sol-ის მაჩვენებელი აქ მხოლოდ 18.1% იყო, ხოლო კონკურენტ Fable 5.1-ს 31.4% უფიქსირდება. საინტერესოა Terminal-Bench Science 0.1 ტესტიც, სადაც Astra 64.6%-ს იღებს Sol-ის 22.4%-ის საპირისპიროდ. აღსანიშნავია SRE-Bench, რომელზეც ოთხი მცდელობის შემდეგ მოდელი თითქმის იდეალურ 99.2%-ს აღწევს, როცა ძველი მოდელი 68.7%-ზე ჩერდებოდა.

მედიცინისა და ბიოლოგიის მიმართულებით მწარმოებლის ციფრები მიუთითებს, რომ GeneBench Pro-ზე მაჩვენებელი 39.0%-ია, ნაცვლად Sol-ის 28.7%-ისა. HealthBench Professional-ის სიგრძეზე კორექტირებულ ვერსიაში 63.4% გვაქვს, მაშინ როცა Sol-ს 60.5% ჰქონდა. შიდა MedChemBench ტესტზე მოდელმა 49.7% დააფიქსირა, რითაც ოდნავ აჯობა Sol-ის 47.4%-ს. ბოლოს, რთულ კითხვებსა და კიბერუსაფრთხოებაში, GPQA Diamond ექსპერტულ ბენჩმარკზე სისტემა 96%-ს აღწევს, ExploitBench-ზე კი აბსოლუტურ 100%-ს. ARC-AGI-3 ტესტში, სპეციალური Provider Adapter ჰარნესის და Responses ფორმატის გამოყენებით, OpenAI-მ 98.6% დააფიქსირა. ეს ციფრები ცხადყოფს, რომ ლაბორატორიულ პირობებში სისტემა სრული დატვირთვით მუშაობს.

თუმცა, Artificial Analysis-ის უახლესი მონაცემებით და დამოუკიდებელი დაკვირვებით, სურათი ოდნავ განსხვავებულია. GPT-6 Astra-მ უმაღლესი ძალისხმევის რეჟიმში Intelligence Index v4.1.1-ზე 61 ქულა აიღო. ეს მაჩვენებელი ზუსტად უტოლდება წინამორბედ GPT-5.6 Sol-ის შედეგს. ბაზრის ლიდერობას კვლავინდებურად ინარჩუნებს Claude Fable 5.1 თავისი 66 ქულით, რომელსაც მოსდევს Claude Opus 5 63 ქულით. Coding Agent Index-ზე, რომელიც პროგრამირების უნარებს ზომავს, Astra-ს მაჩვენებელი დაახლოებით 67-ია, სადაც Fable 5.1 კვლავ წამყვანია 70 ქულით. მიუხედავად ამისა, აუცილებლად უნდა აღინიშნოს კოდის წერის ტოკენების ეფექტურობა: Codex-ის კოდის ჰარნესში ახალი მოდელი Sol-ის მაქსიმალური ტოკენების მხოლოდ დაახლოებით მესამედს ხარჯავს.

ფასების ფორმირებაზე და ეკონომიკურ ეფექტურობაზე საუბრისას, Artificial Analysis მიუთითებს მნიშვნელოვან ზრდაზე. მილიონ შემავალ და გამომავალ ტოკენზე ფასები $10 და $50-ს შეადგენს, რაც წინამორბედ Sol-ის $4 და $20 ღირებულებაზე 2.5-ჯერ მეტია. მარკეტერებისა და ფინანსური მენეჯერებისთვის ეს სერიოზული ფაქტორია, რადგან ანალიტიკოსების თქმით, ყოველი დავალების ღირებულება მაქსიმალური ძალისხმევისას დაახლოებით 75%-ით ძვირი ჯდება, მიუხედავად იმისა, რომ ტოკენების საერთო ხარჯი შემცირებულია. მეორე მხრივ, ინვესტიცია ამართლებს სიზუსტის კუთხით. ფიქსირდება ჰალუცინაციების მკვეთრი შემცირება, კერძოდ, AA-Omniscience მაჩვენებელი 92%-დან 51%-მდე ჩამოვიდა, ანალიტიკური ხარისხი კი სერიოზულად გაიზარდა და ელო ქულა 80-ით გაუმჯობესდა. მიუხედავად ამისა, პრეზენტაციის ხარისხსა და ზოგიერთ სხვა პარამეტრში რეგრესია ფიქსირდება.

ცალკე განხილვის საგანია ARC-AGI-3 ბენჩმარკი და მასთან დაკავშირებული დეტალები. OpenAI-ს მიერ წარმოდგენილმა სარეკლამო სათაურმა 98.6% აჩვენა, რაც სპეციალური Provider Adapter ჰარნესის გამოყენებით მიიღეს და ზოგიერთ ვერსიაში სრული ადაპტაციით 99.9%-საც აღწევს. თუმცა, ARC-ის სტანდარტული ჰარნესის ტესტებში მოდელმა მაქსიმალური მსჯელობის რეჟიმში დაახლოებით 62.7% დააფიქსირა. ორგანიზაციის შიგნით და ექსპერტთა შორის არსებობს აზრთა სხვადასხვაობა იმის შესახებ, თუ რომელი ციფრი უნდა იყოს მთავარი სათაური მედიისთვის, მაგრამ ARC მაინც მიიჩნევს, რომ ეს მოდელი რეალური თაობათა შორის გადასვლაა.

პირველი დღის პრაქტიკული ტესტები და მშენებელთა რეპორტები კიდევ უფრო განსხვავებულ სურათს აჩვენებს. კლერ ვომ და Lenny’s Newsletter-მა გამოაქვეყნეს პირველი დაკვირვებები, სადაც დეტალურად არის აღწერილი ბრაუზერის გამოყენება CRM სისტემებში და ერთჯერადი კოდის წერა ChatPRD პროდუქტის ინტელექტის ფიჩერისთვის, რომელიც წინა ვერსიებზე საერთოდ ვერ სრულდებოდა. დამატებით აღინიშნა Divoom MiniToo ტექნიკური ჰეკი და Blender 3D ასეტების შექმნის პროცესი. თუმცა, მკითხველმა უნდა გაითვალისწინოს, რომ ეს არის მხოლოდ ცალკეული შემქმნელის რეპორტი და არა ლაბორატორიული დასტური. OpenAI-ს ოფიციალურ დემოებში კომპიუტერის გამოყენების უნარები ძირითადად დაფუძნებულია KiCad PCB განლაგებაზე, Unity ინტეგრაციებსა და FreeCAD ფაიფლაინებზე, რომლებსაც მიმწოდებლის დემოების სახით უნდა მივუდგეთ.

აქ შეგიძლიათ ნახოთ კლერ ვოს პრაქტიკული ვიდეო, სადაც ის ინსტრუმენტის შესაძლებლობებს რეალურ დროში ამოწმებს.

დეველოპერების პირველადი შთაბეჭდილებებისა და ტექნიკური შეფასებების სანახავად გთავაზობთ კიდევ ერთ მოკლე ვიდეომასალას.

წყარო: OpenAI Introducing GPT-6 Astra, OpenAI developer first impressions, How I AI / Claire Vo, VentureBeat, Artificial Analysis, ARC Prize, The Verge, OpenAI