
Наближається «момент GPT» для роботів зі штучним інтелектом
Пітер Чен — генеральний директор і співзасновник компанії Covariant, світового лідера в галузі робототехніки на основі штучного інтелекту. До заснування Covariant Пітер був науковим співробітником OpenAI і дослідником у Лабораторії досліджень штучного інтелекту Берклі (BAIR), де він займався питаннями навчання з підкріпленням, метанавчання і неконтрольованого навчання.
Ні для кого не секрет, що фундаментні моделі змінили ШІ в цифровому світі. Великі мовні моделі (LLM), такі як ChatGPT, LLaMA і Bard, зробили революцію в мовному ШІ. Хоча моделі GPT від OpenAI не є єдиними доступними великими мовними моделями, вони домоглися найбільшого визнання, приймаючи текстові та графічні дані і видаючи людиноподібні відповіді — навіть у деяких завданнях, які потребують вирішення складних проблем і складних міркувань. Вірусне і повсюдне поширення ChatGPT багато в чому визначило те, як суспільство розуміє цей новий момент у розвитку штучного інтелекту. Наступне досягнення, яке визначить ШІ для багатьох поколінь, — це робототехніка. Створення роботів зі штучним інтелектом, здатних навчитися взаємодіяти з фізичним світом, поліпшить усі види повторюваної роботи в найрізноманітніших галузях — від логістики, транспорту і виробництва до роздрібної торгівлі, сільського господарства і навіть охорони здоров’я. Це також дасть змогу підвищити ефективність фізичного світу настільки ж, наскільки ми спостерігали в цифровому світі за останні кілька десятиліть.

Хоча в робототехніці існує унікальний набір проблем, які потрібно вирішувати, порівняно з мовами, в основних фундаментальних концепціях є схожість. І деякі з найяскравіших умів у галузі ШІ домоглися значного прогресу у створенні «GPT для робототехніки».
Що забезпечує успіх GPT?
Щоб зрозуміти, як створити «GPT для робототехніки», спочатку розглянемо основні принципи, які забезпечили успіх таких LLM, як GPT.
Підхід на основі базової моделі
GPT — це модель штучного інтелекту, навчена на великому і різноманітному наборі даних. Раніше інженери збирали дані і навчали ШІ для вирішення конкретного завдання. Потім їм потрібно було зібрати нові дані для вирішення іншої проблеми. Ще одна проблема? Знову нові дані. Тепер, при використанні підходу на основі базових моделей, все відбувається з точністю до навпаки. Замість того щоб створювати нішеві ШІ для кожного випадку використання, можна створити один універсальний. І ця одна дуже загальна модель більш успішна, ніж усі спеціалізовані моделі. ШІ в базовій моделі краще справляється з одним конкретним завданням. Він може використовувати знання, отримані під час виконання інших завдань, і краще узагальнювати нові завдання, оскільки набув додаткових навичок завдяки тому, що йому доводиться успішно справлятися з різними завданнями.
Навчання на великому, власному і високоякісному наборі даних
Щоб створити узагальнений ШІ, спочатку потрібно отримати доступ до величезної кількості різноманітних даних. OpenAI отримала реальні дані, необхідні для навчання моделей GPT, досить ефективно. GPT навчався на даних, зібраних з усього інтернету, з великим і різноманітним набором даних, включно з книжками, новинними статтями, повідомленнями в соціальних мережах, кодом і багато іншого.
Створення роботів зі штучним інтелектом, здатних навчитися взаємодіяти з фізичним світом, дасть змогу поліпшити всі види повторюваної роботи.
Важливий не тільки розмір набору даних; величезну роль відіграє також збір високоякісних і цінних даних. Моделі GPT досягли безпрецедентної продуктивності завдяки тому, що їхні високоякісні набори даних містять інформацію переважно про задачі, що хвилюють користувачів, і найбільш корисні відповіді.
Роль навчання з підкріпленням (RL)
В OpenAI використовується навчання з підкріпленням на основі людського зворотного зв’язку (RLHF), щоб узгодити реакцію моделі з вподобаннями людини (наприклад, з тим, що вважається корисним для користувача). Необхідно щось більше, ніж чисте контрольоване навчання (SL), оскільки SL може підходити до проблеми тільки з чітким шаблоном або набором прикладів. LLM вимагають від ШІ досягнення мети без унікальної, правильної відповіді. Вводимо RLHF. RLHF дозволяє алгоритму рухатися до мети методом проб і помилок, тоді як людина визнає правильні відповіді (висока винагорода) або відкидає неправильні (низька винагорода). ШІ знаходить функцію винагороди, яка найкраще пояснює вподобання людини, а потім використовує RL, щоб дізнатися, як досягти мети. ChatGPT може видавати відповіді, які відображають або перевершують можливості людини, завдяки навчанню на основі зворотного зв’язку.
Наступний рубіж використання базових моделей — робототехніка
Та сама технологія, яка дає змогу GPT бачити, думати і навіть говорити, дає змогу машинам бачити, думати і діяти. Роботи, що працюють на основі базової моделі, можуть розуміти навколишнє їхнє фізичне середовище, ухвалювати виважені рішення й адаптувати свої дії до обставин, що змінюються. «GPT для робототехніки» створюється так само, як і GPT, — закладаючи основу для революції, яка вкотре переосмислить ШІ, яким ми його знаємо.
Підхід на основі базової моделі
Використовуючи підхід на основі базової моделі, ви також можете створити єдиний ШІ, який працюватиме з кількома завданнями у фізичному світі. Кілька років тому експерти радили створити спеціалізований ШІ для роботів, які збирають і упаковують продукти. І це відрізняється від моделі, яка може сортувати різні електричні деталі, і від моделі, що розвантажує палети з вантажівки. Зміна парадигми на базову модель дає змогу ШІ краще реагувати на нестандартні сценарії, що часто трапляються в неструктурованому реальному середовищі й інакше можуть загнати в глухий кут моделі з вужчою підготовкою. Створення одного узагальненого ШІ для всіх цих сценаріїв є більш успішним. Саме навчання на всіх сценаріях дає змогу отримати автономність людського рівня, якої так не вистачало попереднім поколінням роботів.
Навчання на великому, власному і високоякісному наборі даних
Навчити робота дізнаватися, які дії призводять до успіху, а які — до невдачі, надзвичайно складно. Для цього потрібні великі високоякісні дані, засновані на реальних фізичних взаємодіях. Поодинокі лабораторні умови або відеоприклади не є надійними або досить міцними джерелами (наприклад, відеоролики на YouTube не передають деталей фізичної взаємодії, а академічні набори даних, як правило, обмежені за обсягом). На відміну від ШІ для мови або опрацювання зображень, жоден з наявних наборів даних не уявляє, як роботи мають взаємодіяти з фізичним світом. Таким чином, великий і якісний набір даних стає складнішим завданням для робототехніки, і розгортання парку роботів на виробництві — єдиний спосіб зібрати різноманітний набір даних.
Роль навчання з підкріпленням
Подібно до відповідей на текстові запитання з людським рівнем здібностей, управління роботами і маніпулювання ними вимагають від агента прагнення до досягнення мети, на яку немає єдиної, унікальної, правильної відповіді (наприклад, «Як вдало зірвати цю червону цибулю»)?«). І в цьому випадку потрібно щось більше, ніж просто контрольоване навчання. Для успіху в робототехніці вам потрібен робот, що працює на глибокому навчанні з підкріпленням (deep reinforcement learning, deep RL). Цей автономний підхід, що самонавчається, поєднує в собі RL з глибокими нейронними мережами, що дає змогу досягти більш високого рівня продуктивності — ШІ автоматично адаптуватиме свої стратегії навчання і продовжуватиме відточувати свої навички в міру того, як він стикатиметься з новими сценаріями…
Наближається складне, вибухове зростання
- Створення продукту на основі ШІ, здатного працювати в різних реальних умовах, пов’язане з цілою низкою складних фізичних вимог. ШІ повинен адаптуватися до різних апаратних додатків, оскільки сумнівно, що одне обладнання працюватиме в різних галузях (логістика, транспорт, виробництво, роздрібна торгівля, сільське господарство, охорона здоров’я тощо). д.) і видах діяльності в межах кожного сектору.
- Склади та розподільчі центри — ідеальне середовище для навчання моделей ШІ у фізичному світі. Зазвичай через будь-який об’єкт у будь-який момент часу проходять сотні тисяч або навіть мільйони різних одиниць зберігання (SKU), що дає змогу отримати великий, власний і високоякісний набір даних, необхідний для навчання «GPT для робототехніки».
Момент GPT для робототехніки зі штучним інтелектом уже близький
Траєкторія зростання моделей роботизованих основ прискорюється дуже швидкими темпами. Робототехнічні додатки, особливо в завданнях, що вимагають точного маніпулювання об’єктами, вже застосовуються в реальних виробничих умовах, і в 2024 році ми побачимо експоненціальну кількість комерційно життєздатних робототехнічних додатків, розгорнутих у масштабі.
Чен опублікував понад 30 наукових праць, які було опубліковано в провідних світових журналах зі штучного інтелекту та машинного навчання.


