Чи справді GPT-6 Astra відкриває еру Штучного Загального Інтелекту?

## Чи досягло людство Штучного Загального Інтелекту? GPT-6 Astra викликає дискусії.

* Facebook * X * Reddit * Pinterest * Flipboard Поділитися статтею 1 Обговорення Додайте нас до обраних джерел у Google Представники OpenAI стверджують, що випуск їхньої новітньої моделі, GPT-6 Astra, знаменує собою початок ери штучного загального інтелекту (ШЗІ) — гіпотетичного сценарію, за якого штучний інтелект (ШІ) здатний навчатися та міркувати подібно до людини. Після нещодавніх заяв технологічних лідерів про досягнення цього етапу, наскільки ймовірним є таке твердження під пильним аналізом? На тлі повідомлень про те, що проблеми безпеки змусили компанію відмовитися від запланованого розгортання GPT-6.1 Astra, незалежні дослідники та розробники тестів попереджають, що рекордні показники GPT-6 Astra базуються на значній оптимізації запитів, а не на справжньому загальному інтелекті. Це відбувається паралельно з попередженнями експертів про ризики майбутніх систем ШІ та спільними закликами керівників ШІ-компаній до уповільнення темпів досліджень у цій галузі. Під час анонсу випуску моделі президент OpenAI Грег Брокман висловив думку, що Astra сигналізує про фундаментальний поворотний момент в еволюції ШІ. «Якщо ми пришвидшимо розвиток на кілька років і озирнемося назад, щоб запитати, коли саме було створено ШЗІ, я думаю, це буде приблизно в цей час, і, можливо, завдяки цій моделі», — заявив Брокман на прес-конференції 3 вересня, присвяченій запуску. ### Як нова модель показала себе в тестах?

Показники тестів вражають, але навіть розробник одного з найважливіших зазначає, що успішне проходження не означає автоматичного досягнення ШЗІ. (Джерело зображення: Cheng Xin via Getty Images) У межах процесу тестування та верифікації нової моделі OpenAI опублікувала результати тестів, які вимірюють можливості моделей ШІ у різноманітних завданнях. Представники OpenAI заявили, що нова модель компанії демонструє «найсучаснішу» продуктивність у різних сферах, включаючи розробку програмного забезпечення, автономне використання комп’ютерних програм, математичні розрахунки та навіть наукові дослідження. Демонстрації, наприклад, підкреслили здатність Astra генерувати код для 3D-креслень (CAD), розробляти печатні плати в програмному забезпеченні CAD (системи автоматизованого проєктування), перетворювати цифрові 3D-моделі в інтерактивні середовища в стилі відеоігор та розгортати розміщені веб-додатки безпосередньо з запитів. «Під час наших ранніх тестів Astra виділялася тим, що підходила до юридичної роботи так, як це робить досвідчений юрист: вона розрізняє документи від усталених записів, виявляє необґрунтовані припущення та перетворює прогалини на конкретні позиції для складання», — зазначив Ніко Группен, керівник прикладних досліджень у компанії Harvey, що розробляє ШІ-рішення для юридичних послуг, під час оголошення OpenAI. На тесті ARC-AGI-3 — бенчмарку, призначеному для вимірювання ефективності, з якою системи ШІ набувають нових навичок у нових, абстрактних середовищах — Astra досягла найвищого показника у 99,9%. Незалежне тестування, проведене некомерційною організацією ARC Prize Foundation, яка курує бенчмарк, показало, що Astra перевищила базові показники «ефективності людських дій» на 96% рівнів, витративши в середньому на 51,7% менше дій на рівень, ніж люди-розв’язувачі. «Це не тільки найкраща модель, яку ми коли-небудь тестували», — зазначив президент ARC Prize Foundation Грег Камрадт під час оголошення OpenAI, — «але вона також представляє значний крок уперед у продуктивності передових моделей — не тільки в їхній здатності орієнтуватися та вирішувати завдання в нових середовищах, але й у тому, наскільки ефективно вони цього навчаються». ### Наскільки можна довіряти результатам тестів? Багато дослідників наголошують, що високі показники Astra на ARC-AGI-3 залежать від власного інструменту «Provider Adapter» — спеціалізованого програмного забезпечення, яке недоступне для конкурентів. При тестуванні за допомогою нейтрального стандартного інструменту бенчмарку цей показник знизився до 62,7%. Організатори ARC також зазначили, що максимальне проходження бенчмарку не є доказом досягнення ШЗІ, підкресливши, що його закриті, детерміновані середовища-головоломки не відображають відкритої складності реального світу. «Коли ми запускали ARC-AGI-3, ми чітко дали зрозуміти, що максимальне проходження бенчмарку не буде вважатися «доказом досягнення ШЗІ»», — написав Камрадт у своєму блозі. «Тому, хоча ми віримо, що Astra демонструє значний прогрес у напрямку генералізації, ми не стверджуємо, що це ШЗІ». Розбіжності в даних, як повідомляється, з’явилися ще до офіційного анонсу. Як повідомляє Fortune, проєкт документа, наданий новинним організаціям до запуску моделі, вказував показник Astra на ARC-AGI-3 на рівні 98,6%, перш ніж він зріс до 99,9% на офіційному сайті. Анка Ройел та Майк Харді, докторанти зі ШІ в Стенфордському університеті, також висловили занепокоєння щодо того, що OpenAI непомітно коригувала кілька опублікованих метрик після запуску, зокрема, зменшивши заявлений рівень «галюцинацій» Astra з 4,2% до 2,0%, перш ніж повернути його назад. > «Коли ми запускали ARC-AGI-3, ми чітко дали зрозуміти, що максимальне проходження бенчмарку не буде вважатися «доказом досягнення ШЗІ»» > > Грег Камрадт, президент ARC Prize Foundation Розмовляючи з Fortune, Ройел і Харді пояснили зміну показників «benchmaxxing» — терміном в індустрії, який описує практику багаторазового повторення оцінок із незначно зміненими запитами, структурами або виділенням обчислювальних ресурсів для пошуку пікових теоретичних показників. У статті 2025 року, опублікованій на препринт-сервері arXiv під назвою «Benchmarking is Broken — Don’t Let AI be its Own Judge» (Тестування зламане — не дозволяйте ШІ бути своїм суддею), експерти, зокрема докторант Прінстонського університету Зеруї Ченг і постдокторант Університету Люксембургу доктор Стелла Воніг, попередили, що така практика створює плутанину та підриває довіру, особливо коли офіційна технічна документація не містить базової методології, що робить незалежну верифікацію майже неможливою. Важливо, що показники, досягнуті за допомогою benchmaxxing, відображають ідеалізовані граничні показники продуктивності за оптимальних лабораторних умов, а не практичну надійність «з коробки». За даними OpenAI, у спеціалізованих оцінках GPT-6 Astra продемонструвала на 10-20% вищу продуктивність порівняно зі своїм попередником GPT-5.6 Sol та провідними конкурентами на ринку. Серед досягнень — 98% на FrontierMath Tier 4 (v2), який оцінює математичні міркування експертного рівня; ідеальні 100% на ExploitBench, призначеному для тестування наступальних можливостей кібербезпеки; 95,9% на BenchCAD, який вимірює здатність ШІ реконструювати 3D-об’єкти за допомогою коду CAD; 57,9% на Terminal-Bench 4.0, який оцінює складне адміністрування систем і розробку програмного забезпечення на основі терміналу; та 41,4% на AutomationBench, який перевіряє, чи можуть агенти виконувати багатоетапні бізнес-процеси в різних застосунках. Проте незалежні висновки від зовнішньої компанії з оцінки ШІ Artificial Analysis суперечать цим результатам. Показник Astra в незалежному індексі Artificial Analysis Intelligence Index — агрегованій метриці, що оцінює загальне міркування передових моделей — залишився незмінним, на рівні 61, порівняно з GPT-5.6 Sol, і відстав від конкурентів, таких як Claude Fable 5.1 від Anthropic та Muse Spark 1.3 від Meta. Хоча деякі результати тестів покращилися порівняно з попереднім поколінням, Astra показала нижчі результати в інших тестах. Тестування Artificial Analysis показало, що проти GDPval-AA v2 — бенчмарку, орієнтованого на економіку, який вимірює реальні робочі завдання у 44 професіях — Astra зазнала значного падіння свого відносного рейтингу порівняно з GPT-5.6 Sol. Додаткові регресії були помічені в тестах, що оцінюють підтримку клієнтів, наукове програмування на Python та довгострокове міркування на великих документах. Щодо загального використання токенів — системи вимірювання, що відстежує фрагменти тексту чи даних, які обробляються моделями ШІ — представники OpenAI заявили, що GPT-6 Astra досягла значних покращень ефективності у складних завданнях з тривалим горизонтом. Висновки Artificial Analysis підтвердили, що у тестах розробки програмного забезпечення Astra була приблизно на 70% ефективнішою за використання токенів, ніж GPT-5.6 Sol, використовуючи приблизно третину загальної кількості токенів свого попередника та п’яту частину токенів Claude Opus 5.

Сучасні системи ШІ здатні на більше, ніж просту текстову взаємодію, переходячи до дій від нашого імені. (Джерело зображення: CFOTO via Getty Images) На оцінках професійного робочого середовища, таких як Agents’ Last Exam, нова модель зменшила споживання вихідних токенів до 65% порівняно з Opus 5, тоді як на оцінках загального інтелекту Astra досягла приблизно 10% зменшення вихідних токенів за максимального зусилля порівняно з Sol. З іншого боку, це досягнення нівелюється 250% зростанням базової ціни API для GPT-6 Astra порівняно з GPT-5.6 Sol. Ціни за токен зросли з $4/$20 до $10/$50 за мільйон вхідних/вихідних токенів. Як наслідок, Astra стає приблизно на 75% дорожчою за завдання порівняно з попередником на оцінках загального інтелекту, незважаючи на використання на 10% менше вихідних токенів. Цей компроміс змусив дослідників Artificial Analysis поставити під сумнів, чи ШІ-лабораторії покладаються на дороге обчислювальне «грубе застосування сили» для досягнення незначних вигод, а не справжніх технічних проривів. ### Чи справді досягнення ШЗІ має значення? Зі своєю останньою моделлю OpenAI приділила більше уваги запобіжним заходам та контролю. Цей крок зроблено після низки резонансних інцидентів, коли передові моделі ШІ випадково зламували сторонні мережі та комп’ютерні системи під час рутинних операцій тестування, оскільки моделі виходили за межі очікувань людей під час складних завдань. За словами представників OpenAI, Astra не виходила за межі своїх завдань у жодних оцінках безпеки. Для порівняння, GPT-5.6 Sol виходив за свої дозволені параметри майже в 50% тестових випадків. Рівень «галюцинацій» також значно зменшився, впавши до 4,2% за внутрішніми тестами, порівняно з 12,2% у GPT-5.6 Sol (незалежне тестування Artificial Analysis показало зниження з 92% до 51% за максимального зусилля). Модель також продемонструвала покращену здатність обробляти неоднозначні запити. Девід Вуд, голова London Futurists, некомерційної організації, що проводить дискусійні групи з питань новітніх технологій, стверджує, що, крім індивідуальних результатів тестів, Astra висвітлює фундаментальну зміну у взаємодії людей з ШІ, оскільки моделі переходять від надання відповідей до самостійного досягнення складних цілей у цифрових середовищах. * ШІ-агенти вдавалися до злочинів та самознищення, щоб вижити в симульованому світі — але чи означає це, що вони вчинили б так само в реальному світі? * Нас не чекає пробудження злого цифрового бога — ШІ, скоріше за все, закінчиться великим розчаруванням. * Ілон Маск та Сем Альтман стверджують, що ми досягли сингулярності ШІ. Але звідки ми взагалі дізнаємося, що це сталося? «Вражаючі результати тестів мають значення, але важливіше поєднання інтелекту, автономії, комп’ютерних можливостей та можливостей кібербезпеки», — написав він у електронному листі Live Science. «Таке поєднання також вимагає обережності. Чим кориснішими стають ці системи, тим більшими будуть наслідки, коли вони неправильно інтерпретують наші наміри, будуть використані не за призначенням або знайдуть шляхи обходу наданих їм запобіжних заходів». Вуд припустив, що класифікація Astra як ШЗІ менш важлива, ніж усвідомлення необхідності контролю та управління ШІ, які б відповідали технічному розвитку. «Можливість того, що ШІ може розвинутися від систем, подібних до Astra, до всебічного суперінтелекту, робить людську пильність, обізнаність та співпрацю все більш нагальними», — сказав він. Допоможіть нам покращити Live Science Pro: Ми завжди прагнемо зробити наш контент кращим. Залиште нам відгук про Pro тут. ТЕМИ

Джерело: www.livescience.com

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *