Українські науковці розробили ШІ: вартість його роботи до 11 разів нижча за розробку OpenAI
Новий ШІ-двигун: Шлях до розуміння, що не вимагає мільярдів доларів

(Джерело зображення: SOPA Images via Getty Images)
• Facebook
• X
• Reddit
• Pinterest
• Flipboard Поділіться цією статтею 0 Приєднайтеся до обговорення Це свідчить про те, що невербальне мислення може стати наступним кроком до розвитку у машин інтелекту, подібного до людського. У новому дослідженні, опублікованому 10 серпня на препринт-сервері arXiv, науковці компанії Pathway AI детально описали технічні основи своєї нової моделі BDH-CQ. Ця розробка є наступницею попередньої моделі “Dragon Hatchling”, створеної у 2025 році, яка була покликана точно симулювати зв’язок та зміцнення нейронів у мозку під час навчання. У новому дослідженні науковці оцінили продуктивність BDH-CQ порівняно з фундаментальним бенчмарком 2019 року, який допоміг встановити поточний стандарт для вимірювання прогресу в напрямку загального штучного інтелекту (AGI) — моменту, коли ШІ досягне або перевищить людські можливості у всіх сферах.
Оцінка невербального мислення
Бенчмарк 2019 року, відомий як ARC-AGI, використовує головоломки на невербальне мислення — наприклад, обертання серії фігур для завершення послідовності — для вимірювання когнітивних здібностей систем ШІ. Якщо люди висококваліфіковані у виведенні правил таких завдань методом спроб і помилок, то ранні системи ШІ історично демонстрували значно нижчі результати. BDH-CQ продемонструвала результат майже 30% на бенчмарку ARC-AGI-1, успішно розв’язавши еквівалент трьох з десяти завдань за дві або менше спроб. Хоча численні моделі досягли значно кращих показників у цьому тесті, базовий підхід до міркувань, на якому базується BDH-CQ, робить її розмір та витрати на використання значно меншими порівняно з моделями, побудованими на традиційній архітектурі на основі трансформерів. Наприклад, хоча модель OpenAI початкового рівня GPT 5.6 Luna (Low) досягла трохи вищого результату, дослідження стверджує, що це “скромне підвищення точності” коштувало приблизно в 11 разів дорожче, ніж BDH-CQ, з точки зору відносних витрат на токени — системи вимірювання, яку компанії ШІ використовують для обліку вартості роботи систем ШІ. Вчені вважають, що цей тип архітектури моделей ШІ, якщо його широко впровадять, може суттєво вплинути на загальну вартість та масштаби розгортання ШІ.
Більше, ніж здається на перший погляд
BDH-CQ навчалася лише на 150 мільйонах параметрів, тоді як найсучасніші моделі ШІ, такі як відкриті Llama 3 70B від Meta або Llama 3.1 405B, зазвичай мають десятки або сотні мільярдів параметрів. У світі розробки ШІ менша кількість параметрів означає, що моделі навчаються швидше та дешевше в експлуатації. Проте, дослідники зазначили, що ці результати також свідчать про значний потенціал масштабування когнітивних здібностей моделі при розширенні до більших розмірів параметрів. Причина такого стрибка продуктивності полягає в тому, що модель Pathway використовує те, що науковці компанії описують як “пост-трансформерну” архітектуру. Більшість основних моделей ШІ, таких як ті, що забезпечують роботу Claude та ChatGPT, базуються на “трансформерних моделях”, названих так тому, що вони перетворюють вхідні дані користувача на взаємопов’язані математичні точки відліку. Ці системи одночасно розглядають кожне слово у вхідних даних, що дозволяє їм виводити контекст із позиції, наприклад, визначати на основі сусідніх слів, чи належить слово “кора” до собак чи дерев.

Найкращі моделі ШІ зазнали критики за високу вартість експлуатації. (Джерело зображення: Jaque Silva/NurPhoto via Getty Images) Трансформерна модель формує свої відповіді на запити користувача, одночасно переглядаючи весь запит, а потім прогнозуючи наступне слово у послідовності своєї відповіді. Вона робить це слово за словом, використовуючи природну мову для ефективної вербалізації лінійного ланцюжка думок у фоновому режимі. Міркування трансформерів також працюють послідовно, що означає, що вони повинні проходити кожен етап проблеми у строго лінійному порядку. Ці моделі мають значні переваги перед попередніми архітектурами, які часто забували початок вхідних даних до моменту досягнення кінця. Однак трансформерні архітектури можуть мати проблеми з довшими або складнішими запитами, оскільки обчислювальна складність оцінки запиту зростає квадратично — це означає, що подвоєння довжини вхідних даних вимагає в чотири рази більше обчислювальної потужності. Використання моделей ШІ вимірюється на основі токенів, де токен представляє будь-який фрагмент даних (еквівалентний приблизно чотирьом символам тексту), який ШІ повинен обробити або вивести. Оскільки складніші запити вимагають довших ланцюжків міркувань з багатьма кроками, обробка та відповіді на ці запити можуть призвести до значного споживання токенів.
Наступне покоління ШІ?
Традиційна генерація токенів на основі трансформерів схильна викликати вузькі місця в пам’яті, оскільки ШІ повторно читає кожне попереднє слово в розмові з кожним новим згенерованим словом. Зрештою, це призведе до перевантаження пам’яті графічних процесорів (GPU), що використовуються для операцій ШІ. З цієї причини масштабування міркувань ШІ стало дорогим обчислювальним викликом. Пост-трансформерний підхід Pathway змінює спосіб зберігання та обробки пам’яті ШІ про розмову та зв’язок між частинами інформації. Він замінює текстові журнали новими інструментами, включаючи покращену короткострокову пам’ять та механізм, що дозволяє обробляти проблеми без споживання токенів. Трансформерні моделі зберігають запити та історію взаємодії як довгий рядок числових значень, що представляють текст запитів. Потім цей рядок розширюється, коли додаються нові токени під час обробки запиту. BDH-CQ використовує числові масиви для представлення базових правил та контекстних шаблонів завдання, використовуючи числа для відстеження зв’язків між фрагментами інформації, а не для визначення їх у тексті. Ці масиви представляють вектори — спрямовану інформацію, яка вказує на іншу точку на теоретичній карті, що зберігається в пам’яті GPU як частина навчальних даних, імплантованих під час створення моделі. Науковці зазначили в дослідженні, що це дозволяє моделі обробляти складні абстрактні міркування без збільшення її обсягу пам’яті або обчислювальних витрат. Для виконання завдань BDH-CQ використовує “латентний рушій міркувань” як свій внутрішній робочий простір. Використовуючи числа для представлення різних елементів запиту або проблеми, вона виконує серію ітеративних рекурентних циклів для визначення найкращої відповіді, яку слід повернути на основі запиту. Модель бере вихідні дані останнього циклу, оцінює, як результат може бути покращений на основі її навчальних даних, і подає попередні вихідні дані як відправну точку для наступної ітерації. Вона повторює це для попередньо встановленої кількості циклів, причому кожна ітерація теоретично наближається до бажаного результату. Щоб вирішувати складніші проблеми, що потребують більше часу на обдумування, BDH-CQ може виконувати більше циклів. Це збільшує час, але обсяг пам’яті та обчислювальної потужності, що споживається, не масштабується з більшою кількістю спроб — теоретично, модель споживатиме сталу пропорційність пам’яті та потужності, виконуючи 200 циклів, так само, як і при виконанні 20 циклів. Натомість стандартні трансформерні моделі досягають додаткового часу на обдумування шляхом генерації довгих ланцюжків текстових токенів, що експоненціально споживає пам’ять GPU та обчислювальну потужність у кластері ШІ.
• Штучний інтелект виявив слабке місце в одній з найбільш досліджуваних систем шифрування у світі — чи під загрозою ваші дані?
• ШІ може прискорити науковий прогрес — але ось чому він не може замінити людських вчених
• ШІ незабаром може думати так, як ми навіть не розуміємо, збільшуючи ризик невідповідності — попереджають науковці з Google, Meta та OpenAI Результати моделі на бенчмарку ARC-AGI-1 були незалежно перевірені та відтворені видатними дослідниками в галузі ШІ, включаючи дослідника з NYU Річарда Чжуна, а також Лукашем Кайзером, співавтором фундаментальної статті 2017 року “Attention Is All You Need”, яка представила концепцію трансформерів у великих мовних моделях. “Я уважно стежу за Pathway і сам відтворив їхні результати ARC-AGI-1”, — заявив Кайзер. “Pathway показує, що архітектура моделі, а не лише масштаб, може стимулювати наступний стрибок у міркуваннях ШІ”. Pathway планує масштабувати архітектуру BDH до 600 мільярдів параметрів і застосувати її векторизовані міркування до більш складних бенчмарків, таких як ARC-AGI-2 та ARC-AGI-3, а також розробити повноцінну велику мовну модель (LLM) на основі цієї технології, яка послужить основою для створення текстових чат-ботів. Компанія сподівається, що технологія може бути застосована до складних завдань міркування у таких секторах, як реагування на інциденти кібербезпеки та промислові операції.
Порада від Business News:
Ця розробка відкриває шлях до більш доступних та ефективних систем штучного інтелекту. Можливість досягти подібних результатів з меншими витратами може значно прискорити впровадження ШІ в бізнесі, особливо для компаній, які раніше не могли собі дозволити дороге обладнання та послуги. Зокрема, зниження вартості обробки складних запитів робить ШІ-рішення більш практичними для повсякденних завдань та аналітики.
Sourse: www.livescience.com
