Непрозора рекурентність та інші терміни про ШІ, які вам, імовірно, варто знати
ШІ переписує світ і водночас винаходить цілу нову мову, щоб описати, як саме він це робить. Сьогодні зайдіть на будь-яку зустріч щодо продукту, презентацію чи панельну дискусію — і почуєте, як люди кидаються словами LLM, RAG, RLHF, а від минулого тижня ще й термінами на кшталт «непрозора рекурентність» — технікою міркування в новій моделі OpenAI Astra, яка схвилювала дослідників безпеки ШІ. Словник змінюється так швидко, що навіть дуже розумні люди у світі технологій можуть почуватися трохи невпевнено.
Цей глосарій — наша спроба це виправити: прості визначення термінів, пов’язаних із ШІ, які ви найімовірніше зустрінете, незалежно від того, чи створюєте ви щось із використанням цих технологій, інвестуєте в них або просто намагаєтеся стежити за подіями, читаючи TechCrunch чи слухаючи відповідні подкасти. Ми регулярно оновлюємо його в міру розвитку галузі, тож вважайте цей текст живим документом — майже як системи ШІ, які він описує.
AGI
Штучний загальний інтелект, або AGI, — розмитий термін. Але загалом він означає ШІ, який перевершує середню людину в багатьох, якщо не в більшості, завдань. Генеральний директор OpenAI Сем Альтман якось описав AGI як «еквівалент середньостатистичної людини, яку можна найняти як колегу». Тим часом статут OpenAI визначає AGI як «високоавтономні системи, що перевершують людей у більшості економічно цінних видів діяльності». Розуміння Google DeepMind дещо відрізняється від цих двох визначень: лабораторія вважає AGI «ШІ, який щонайменше не поступається людям у більшості когнітивних завдань». Заплуталися? Не хвилюйтеся — експерти, які перебувають на передньому краї досліджень ШІ, теж.
Агент ШІ
Агент ШІ — це інструмент, який використовує технології ШІ для виконання від вашого імені низки завдань, що виходять за межі можливостей простішого чат-бота на основі ШІ: наприклад, оформлення витрат, бронювання квитків чи столика в ресторані або навіть написання й обслуговування коду. Однак, як ми вже пояснювали, у цьому новому просторі є багато змінних складових, тож «агент ШІ» може означати різні речі для різних людей. Інфраструктура для реалізації передбачених можливостей таких агентів також досі розбудовується. Але базова концепція передбачає автономну систему, яка може спиратися на кілька систем ШІ для виконання багатокрокових завдань.
Кінцеві точки API
Уявляйте кінцеві точки API як «кнопки» на задній панелі програмного забезпечення, які інші програми можуть натискати, щоб змусити його виконувати певні дії. Розробники використовують ці інтерфейси для створення інтеграцій — наприклад, щоб один застосунок міг отримувати дані з іншого або щоб агент ШІ міг безпосередньо керувати сторонніми сервісами, не змушуючи людину вручну працювати з кожним інтерфейсом. Більшість пристроїв розумного дому та підключених платформ мають такі приховані кнопки, навіть якщо звичайні користувачі ніколи їх не бачать і не взаємодіють із ними. У міру того як агенти ШІ стають потужнішими, вони дедалі частіше можуть самостійно знаходити й використовувати ці кінцеві точки, відкриваючи широкі — а іноді й неочікувані — можливості для автоматизації.
Ланцюжок міркувань
На просте запитання людський мозок може відповісти, майже не замислюючись, — наприклад: «Яка тварина вища — жираф чи кіт?» Але в багатьох випадках, щоб отримати правильну відповідь, вам знадобляться ручка й папір, оскільки є проміжні кроки. Наприклад, якщо у фермера є кури й корови, а разом у них 40 голів і 120 ніг, вам, можливо, доведеться записати просте рівняння, щоб знайти відповідь (20 курей і 20 корів).
У контексті ШІ міркування за принципом ланцюжка думок для великих мовних моделей означає розбиття проблеми на менші проміжні кроки для підвищення якості кінцевого результату. Зазвичай відповідь надходить довше, але ймовірність її правильності вища, особливо в завданнях із логіки чи програмування. Моделі міркування розробляються на основі традиційних великих мовних моделей і оптимізуються для мислення за принципом ланцюжка думок завдяки навчанню з підкріпленням.
(Див.: Велика мовна модель)
Агенти програмування
Це конкретніше поняття, ніж «агент ШІ», тобто програма, яка може самостійно, крок за кроком, виконувати дії для досягнення мети. Агент програмування — це спеціалізована версія, застосовувана для розробки програмного забезпечення. Замість того щоб просто пропонувати код для перевірки й вставлення людиною, агент програмування може автономно писати, тестувати та налагоджувати код, виконуючи ітеративну роботу методом проб і помилок, яка зазвичай займає весь робочий день розробника. Такі агенти можуть працювати з цілими кодовими базами, знаходити помилки, запускати тести й вносити виправлення за мінімального нагляду людини. Уявіть, що ви найняли дуже швидкого стажера, який ніколи не спить і не втрачає концентрації, — хоча, як і в роботі з будь-яким стажером, людині все одно потрібно перевіряти результат.
Обчислювальні ресурси
Хоча це дещо багатозначний термін, обчислювальні ресурси зазвичай означають критично важливу обчислювальну потужність, яка дає змогу працювати моделям ШІ. Такий тип обробки даних живить індустрію ШІ, надаючи їй можливість навчати й розгортати потужні моделі. Цей термін часто є скороченим позначенням апаратного забезпечення, яке забезпечує обчислювальну потужність: графічних процесорів (GPU), центральних процесорів (CPU), тензорних процесорів (TPU) та інших видів інфраструктури, що становлять основу сучасної індустрії ШІ.
Глибинне навчання
Підвид машинного навчання, що самовдосконалюється, у якому алгоритми ШІ побудовані на багатошаровій структурі штучної нейронної мережі (ШНМ). Це дає їм змогу виявляти складніші кореляції порівняно з простішими системами на основі машинного навчання, такими як лінійні моделі або дерева рішень. Структура алгоритмів глибинного навчання надихається взаємопов’язаними шляхами нейронів у людському мозку.
Моделі ШІ на основі глибинного навчання можуть самостійно визначати важливі характеристики даних, замість того щоб вимагати від інженерів-людей визначати ці ознаки. Ця структура також підтримує алгоритми, здатні навчатися на помилках і завдяки процесу повторення та коригування покращувати власні результати. Однак системам глибинного навчання потрібно багато точок даних для отримання якісних результатів (мільйони або більше). Зазвичай їм також потрібно більше часу на навчання порівняно з простішими алгоритмами машинного навчання, тому витрати на розробку, як правило, вищі.
(Див.: Нейронна мережа)
Дифузія
Дифузія — технологія, що лежить в основі багатьох моделей ШІ для генерування зображень, музики й тексту. Натхненні фізикою, дифузійні системи повільно «руйнують» структуру даних — наприклад, фотографій, пісень тощо — додаючи шум, доки нічого не залишається. У фізиці дифузія є спонтанною та незворотною: цукор, що розчинився в каві, не можна повернути у форму кубика. Але дифузійні системи в ШІ прагнуть навчитися своєрідного процесу «зворотної дифузії», щоб відновлювати зруйновані дані, отримуючи здатність відновлювати їх із шуму.
Дистиляція
Дистиляція — це техніка вилучення знань із великої моделі ШІ за допомогою моделі «вчитель-учень». Розробники надсилають запити моделі-вчителю та записують результати. Іноді відповіді порівнюють із набором даних, щоб перевірити їхню точність. Потім ці результати використовують для навчання моделі-учня, яку навчають наближати поведінку вчителя.
Дистиляцію можна використовувати для створення меншої та ефективнішої моделі на основі більшої моделі з мінімальними втратами під час дистиляції. Імовірно, саме так OpenAI розробила GPT-4 Turbo — швидшу версію GPT-4.
Хоча всі компанії у сфері ШІ використовують дистиляцію всередині своїх організацій, деякі компанії могли також застосовувати її, щоб наздогнати передові моделі. Дистиляція з моделі конкурента зазвичай порушує умови використання API та чат-асистентів на основі ШІ.
Тонке налаштування
Це подальше навчання моделі ШІ для оптимізації її роботи під конкретніше завдання або сферу, ніж ті, на яких раніше зосереджувалося її навчання, — зазвичай шляхом подачі нових спеціалізованих (тобто орієнтованих на завдання) даних.
Багато стартапів у сфері ШІ беруть великі мовні моделі за основу для створення комерційного продукту, але прагнуть підвищити корисність для певного сектора чи завдання, доповнюючи попередні цикли навчання тонким налаштуванням на основі власних галузевих знань і досвіду.
(Див.: Велика мовна модель [LLM])
GAN
GAN, або генеративно-змагальна мережа, — це тип фреймворку машинного навчання, який лежить в основі деяких важливих розробок у генеративному ШІ, коли йдеться про створення реалістичних даних, зокрема (але не лише) інструментів для дипфейків. GAN передбачає використання пари нейронних мереж: одна з них спирається на навчальні дані, щоб створити результат, який передається іншій моделі для оцінювання.
По суті, ці дві моделі запрограмовані на те, щоб перевершити одна одну. Генератор намагається провести свій результат повз дискримінатор, тоді як дискримінатор прагне виявити штучно згенеровані дані. Це структуроване змагання може оптимізувати результати ШІ, роблячи їх реалістичнішими без додаткового втручання людини. Водночас GAN найкраще працюють у вузьких сферах застосування (наприклад, для створення реалістичних фотографій або відео), а не для ШІ загального призначення.
Галюцинація
Галюцинація — це термін, якому індустрія ШІ надає перевагу для опису ситуацій, коли моделі ШІ вигадують щось — буквально генерують неправильну інформацію. Очевидно, це величезна проблема для якості ШІ.
Галюцинації породжують результати генеративного ШІ, які можуть вводити в оману й навіть створювати ризики в реальному житті — із потенційно небезпечними наслідками (наприклад, запит про здоров’я, у відповідь на який надається шкідлива медична порада).
Вважається, що проблема вигадування інформації системами ШІ виникає через прогалини в навчальних даних. Галюцинації сприяють переходу до дедалі більш спеціалізованих та/або вертикальних моделей ШІ, тобто галузевих систем ШІ, яким потрібна вужча експертиза, як способу зменшити ймовірність прогалин у знаннях і скоротити ризики дезінформації.
Інференс
Інференс — це процес запуску моделі ШІ. Це надання моделі можливості робити прогнози або висновки на основі раніше побачених даних. Важливо зазначити, що інференс неможливий без навчання: модель має вивчити закономірності в наборі даних, перш ніж зможе ефективно екстраполювати на основі цих навчальних даних.
Інференс можуть виконувати різні типи апаратного забезпечення — від процесорів смартфонів до потужних графічних процесорів і спеціально розроблених прискорювачів ШІ. Але не всі вони можуть однаково добре запускати моделі. Дуже великим моделям знадобилися б цілі століття для створення прогнозів на ноутбуці порівняно з хмарним сервером із висококласними чипами для ШІ.
[Див.: Навчання]
Велика мовна модель (LLM)
Великі мовні моделі, або LLM, — це моделі ШІ, які використовують популярні асистенти на основі ШІ, зокрема ChatGPT, Claude, Gemini від Google, AI Llama від Meta, Microsoft Copilot або Le Chat від Mistral. Коли ви спілкуєтеся з асистентом на основі ШІ, ви взаємодієте з великою мовною моделлю, яка обробляє ваш запит безпосередньо або за допомогою різних доступних інструментів, таких як вебперегляд чи інтерпретатори коду.
LLM — це глибинні нейронні мережі, що складаються з мільярдів числових параметрів (або вагових коефіцієнтів, див. нижче), які вивчають взаємозв’язки між словами й фразами та створюють представлення мови — своєрідну багатовимірну карту слів.
Ці моделі створюються шляхом кодування закономірностей, які вони знаходять у мільярдах книг, статей і стенограм. Коли ви подаєте LLM запит, модель генерує найімовірнішу закономірність, яка відповідає цьому запиту.
(Див.: Нейронна мережа)
Кеш пам’яті
Кеш пам’яті — це важливий процес, який прискорює інференс (процес, унаслідок якого ШІ генерує відповідь на запит користувача). По суті, кешування — це метод оптимізації, покликаний зробити інференс ефективнішим. Очевидно, ШІ працює завдяки складним математичним обчисленням, і щоразу, коли ці обчислення виконуються, вони споживають додаткову потужність. Кешування покликане зменшити кількість обчислень, які може знадобитися виконати моделі, зберігаючи певні обчислення для майбутніх запитів і операцій користувача. Існують різні види кешування пам’яті, але одним із найвідоміших є KV-кешування (або кешування ключ-значення). KV-кешування працює в моделях на основі трансформерів і підвищує ефективність, забезпечуючи швидші результати завдяки скороченню часу (та алгоритмічної роботи), необхідного для генерування відповідей на запитання користувачів.
(Див.: Інференс)
Протокол контексту моделі (MCP)
Протокол контексту моделі, або MCP, — це відкритий стандарт, який дає моделям ШІ змогу підключатися до зовнішніх інструментів і даних — ваших файлів, баз даних або застосунків на кшталт Slack і Google Drive — без необхідності розробнику створювати окремий конектор для кожної пари. Уявіть це як порт USB-C для ШІ. Anthropic представила MCP у 2024 році, а згодом передала його Linux Foundation. Відтоді його запровадили OpenAI, Google і Microsoft, що зробило його одним зі стандартів, які найшвидше поширюються в новітній історії ШІ.
Суміш експертів (MoE)
Суміш експертів — це архітектура моделі, яка розділяє нейронну мережу на багато менших спеціалізованих підмереж, або «експертів», і активує лише кілька з них для виконання конкретного завдання. Замість того щоб спрямовувати кожен запит через усю модель — наче скликати весь офіс для відповіді на кожне запитання, — модель MoE має вбудований «маршрутизатор», який обирає саме потрібних фахівців для виконання завдання. Це дає змогу створювати величезні моделі, які залишаються відносно швидкими й недорогими в роботі, оскільки одночасно працює лише частина мережі. Модель Mixtral від Mistral AI є відомим прикладом; також вважається, що новіші моделі GPT від OpenAI використовують певну версію цього підходу, хоча компанія ніколи офіційно цього не підтверджувала.
(Див.: Нейронна мережа, глибинне навчання)
Нейронна мережа
Нейронна мережа — це багатошарова алгоритмічна структура, яка лежить в основі глибинного навчання і, ширше, буму генеративних інструментів ШІ, що почався після появи великих мовних моделей.
Хоча ідея надихатися щільно взаємопов’язаними шляхами людського мозку під час розробки алгоритмів обробки даних сягає ще 1940-х років, саме значно пізніший розвиток графічного процесорного обладнання (GPU) завдяки індустрії відеоігор по-справжньому розкрив потенціал цієї теорії. Ці чипи виявилися добре пристосованими для навчання алгоритмів із набагато більшою кількістю шарів, ніж це було можливо в попередні епохи, — завдяки чому системи ШІ на основі нейронних мереж досягли значно кращих результатів у багатьох сферах, зокрема в розпізнаванні голосу, автономній навігації та відкритті ліків.
(Див.: Велика мовна модель [LLM])
Нейронез
Гіпотетичний найгірший сценарій, за якого модель міркує виключно у своїх внутрішніх числових представленнях, а не мовою, зрозумілою людям, перетворюючи процес мислення на цілковиту чорну скриньку. Сьогодні жодна випущена модель не працює саме так — OpenAI заявила, що її модель Astra (випущена у вересні 2026 року та відома раннім використанням техніки міркування «непрозора рекурентність») зберігає зрозумілий ланцюжок думок і заперечила порівняння з нейронезом. Однак дослідники безпеки вказують на використання Astra непрозорої рекурентності — її визначення наведено нижче — як на реальний перший крок у цьому напрямку. Саме тому термін набув поширення після повідомлень про запуск Astra.
Непрозора рекурентність
Непрозора рекурентність — це ситуація, коли модель ШІ багаторазово пропускає один і той самий запит через свої внутрішні шари, замість того щоб міркувати покроково зрозумілою мовою. Це ефективніше: менші моделі можуть демонструвати результати, що перевищують їхні очікувані можливості, використовуючи менше обчислювальних ресурсів, — але залишає набагато менше зрозумілих слідів, ніж звичайний ланцюжок думок (той коментар, який ви бачите після прохання до чат-бота про допомогу). Це непокоїть дослідників безпеки, оскільки такі журнали є ключовим інструментом для виявлення неправильної поведінки, а ця техніка може значно ускладнити такий нагляд.
(Див.: Ланцюжок міркувань)
Відкритий код
Відкритий код означає програмне забезпечення або, дедалі частіше, моделі ШІ, базовий код яких доступний для публічного використання, перевірки чи модифікації. У світі ШІ яскравим прикладом є сімейство моделей Llama від Meta; відомою історичною аналогією в операційних системах є Linux. Підходи з відкритим кодом дають змогу дослідникам, розробникам і компаніям у всьому світі будувати свої рішення на основі роботи одне одного, прискорюючи прогрес і забезпечуючи незалежні аудити безпеки, які закриті системи не можуть легко запропонувати. Закритий код означає, що код є приватним: ви можете користуватися продуктом, але не бачите, як він працює, як у випадку з моделями GPT від OpenAI. Це розрізнення стало однією з визначальних дискусій в індустрії ШІ.
Паралелізація
Паралелізація означає виконання багатьох дій одночасно, а не послідовно, — якби 10 працівників одночасно працювали над різними частинами проєкту, замість того щоб один працівник робив усе по черзі. У ШІ паралелізація має фундаментальне значення і для навчання, і для інференсу: сучасні GPU спеціально розроблені для виконання тисяч обчислень паралельно, що є однією з головних причин їхнього перетворення на апаратну основу індустрії. У міру того як системи ШІ ускладнюються, а моделі збільшуються, здатність розподіляти роботу між великою кількістю чипів і машин стала одним із найважливіших чинників, що визначають швидкість і економічність створення та розгортання моделей. Дослідження кращих стратегій паралелізації нині є окремою галуззю.
RAMageddon
RAMageddon — це новий кумедний термін для не надто кумедної тенденції, що охоплює технологічну індустрію: дедалі більшого дефіциту оперативної пам’яті, або чипів RAM, які живлять практично всі технологічні продукти, якими ми користуємося в повсякденному житті. У міру розквіту індустрії ШІ найбільші технологічні компанії та лабораторії ШІ — усі вони прагнуть створити найпотужніший і найефективніший ШІ — закуповують стільки оперативної пам’яті для своїх дата-центрів, що для решти з нас її майже не залишається. А це обмеження постачання означає, що те, що залишилося, стає дедалі дорожчим.
Це стосується таких галузей, як ігрова індустрія (де великим компаніям довелося підвищити ціни на консолі, оскільки знайти чипи пам’яті для їхніх пристроїв стало складніше), споживча електроніка (де дефіцит пам’яті може спричинити найбільше за понад десятиліття падіння поставок смартфонів) та корпоративні обчислення загалом (оскільки такі компанії не можуть отримати достатньо оперативної пам’яті для власних дата-центрів). Очікується, що стрімке зростання цін припиниться лише після завершення цього жахливого дефіциту, але, на жаль, ознак того, що це станеться найближчим часом, майже немає.
Рекурентна глибина
Це більш «технічна» назва того самого методу, що й непрозора рекурентність (багаторазове пропускання запиту через шари моделі замість послідовного міркування мовою). Медіа використовують ці два терміни майже взаємозамінно, тому ми включили його сюди, хоча «рекурентна глибина» — інженерний термін, а «непрозора рекурентність» — формулювання, що підкреслює проблему безпеки.
(Див. Непрозора рекурентність, ланцюжок міркувань.)
Рекурсивне самовдосконалення
Як і AGI, рекурсивне самовдосконалення є порогом, що визначає, наскільки розумним може стати ШІ та наскільки мало він може покладатися на людей. У сценарії RSI моделі ШІ починають удосконалювати себе без втручання людини, що призводить до величезного прискорення їхніх можливостей і автономності. У деяких трактуваннях це був би катастрофічний момент, подібний до сингулярності, — момент, коли моделі ШІ стають несприйнятливими до зовнішнього втручання. Але RSI також описує базову можливість: чи може модель ШІ створити власного наступника? — що значно спрощує інженерам спроби її реалізувати. Низка нещодавніх стартапів у сфері ШІ взялася створювати моделі, здатні до рекурсивного самовдосконалення, але більшість із них відкидає апокаліптичні наслідки, представляючи RSI просто як наступний рубіж досліджень.
Навчання з підкріпленням
Навчання з підкріпленням — це спосіб навчання ШІ, за якого система вчиться, пробуючи різні дії та отримуючи винагороди за правильні відповіді, — наче ви навчаєте улюбленого домашнього улюбленця за допомогою ласощів, тільки «улюбленець» у цьому випадку — нейронна мережа, а «ласощі» — математичний сигнал, що вказує на успіх. На відміну від навчання з учителем, коли модель навчається на фіксованому наборі позначених прикладів, навчання з підкріпленням дає моделі змогу досліджувати середовище, виконувати дії та безперервно оновлювати свою поведінку на основі отриманого зворотного зв’язку. Цей підхід виявився особливо ефективним для навчання ШІ грати в ігри, керувати роботами та, останнім часом, удосконалювати здатність великих мовних моделей міркувати. Такі методи, як навчання з підкріпленням на основі відгуків людей (RLHF), нині відіграють центральну роль у тому, як провідні лабораторії ШІ налаштовують свої моделі, щоб зробити їх кориснішими, точнішими та безпечнішими.
Токен
Коли йдеться про комунікацію між людиною та машиною, виникають очевидні труднощі: люди спілкуються людською мовою, тоді як програми ШІ виконують завдання за допомогою складних алгоритмічних процесів, що спираються на дані. Токени долають цей бар’єр: це базові будівельні блоки комунікації між людиною та ШІ, які представляють дискретні сегменти даних, оброблені або створені LLM. Вони формуються в процесі, що називається токенізацією: він розбиває необроблений текст на невеликі одиниці, які може засвоїти мовна модель, подібно до того, як компілятор перекладає людську мову в двійковий код, зрозумілий комп’ютеру. У корпоративному середовищі токени також визначають вартість: більшість компаній у сфері ШІ стягують плату за використання LLM за кількістю токенів, тобто що більше компанія використовує, то більше платить.
Пропускна здатність токенів
Отже, токени — це невеликі фрагменти тексту, часто частини слів, а не цілі слова, на які мовні моделі ШІ розбивають мову перед її обробкою; для цілей розуміння навантаження на ШІ вони приблизно відповідають «словам». Пропускна здатність означає, який обсяг можна обробити за певний проміжок часу, тож пропускна здатність токенів — це фактично показник того, який обсяг роботи ШІ система може виконати одночасно. Висока пропускна здатність токенів є ключовою метою для команд, що працюють з інфраструктурою ШІ, оскільки вона визначає, скільки користувачів модель може обслуговувати одночасно і наскільки швидко кожен із них отримує відповідь. Дослідник ШІ Анджей Карпаті розповідав, що відчуває тривогу, коли його підписки на ШІ простоюють, — це нагадує йому відчуття, яке він мав у студентські роки, коли дороге комп’ютерне обладнання не використовувалося на повну. Це почуття добре пояснює, чому максимізація пропускної здатності токенів стала своєрідною нав’язливою ідеєю в галузі.
Навчання
Розробка ШІ на основі машинного навчання передбачає процес, відомий як навчання. Простими словами, це подача даних, завдяки яким модель може вивчати закономірності та генерувати корисні результати. По суті, це процес реагування системи на характеристики даних, який дає їй змогу адаптувати результати до бажаної мети — чи то розпізнавання зображень котів, чи то створення хайку на замовлення.
Навчання може бути дорогим, оскільки потребує великої кількості вхідних даних, а необхідні обсяги постійно зростають. Саме тому гібридні підходи, наприклад тонке налаштування ШІ на основі правил за допомогою цільових даних, можуть допомогти контролювати витрати, не починаючи все повністю з нуля.
[Див.: Інференс]
Трансферне навчання
Техніка, за якої раніше навчену модель ШІ використовують як основу для розробки нової моделі для іншого, але зазвичай пов’язаного завдання, що дає змогу повторно застосувати знання, отримані під час попередніх циклів навчання.
Трансферне навчання може підвищити ефективність і скоротити витрати завдяки прискоренню розробки моделі. Воно також може бути корисним, коли обсяг даних для завдання, під яке розробляють модель, дещо обмежений. Але важливо зазначити, що цей підхід має обмеження. Моделям, які покладаються на трансферне навчання для набуття узагальнених можливостей, імовірно, знадобиться навчання на додаткових даних, щоб добре працювати у своїй цільовій сфері
(Див.: Тонке налаштування)
Помилка валідації
Помилка валідації — це число, яке показує, наскільки добре модель ШІ навчається під час тренування, причому що менше число, то краще. Дослідники уважно стежать за ним як за своєрідним звітом у реальному часі, використовуючи його, щоб вирішити, коли припинити навчання, коли скоригувати гіперпараметри або чи потрібно розслідувати потенційну проблему. Одне з ключових явищ, на які воно допомагає вказати, — перенавчання, коли модель запам’ятовує навчальні дані замість того, щоб по-справжньому вивчати закономірності, які можна узагальнити для нових ситуацій. Уявіть різницю між учнем, який справді розуміє матеріал, і тим, хто просто завчив торішній іспит: помилка валідації допомагає визначити, ким із них стає ваша модель.
Ваги
Ваги є основою навчання ШІ, оскільки визначають, наскільки важливими (або «вагомими») є різні ознаки (або вхідні змінні) у даних, використаних для навчання системи, — таким чином формуючи результат роботи моделі ШІ.
Іншими словами, ваги — це числові параметри, які визначають, що є найважливішим у наборі даних для конкретного завдання навчання. Свою функцію вони виконують, застосовуючи множення до вхідних даних. Навчання моделі зазвичай починається з випадково призначених ваг, але в міру розвитку процесу ваги коригуються, оскільки модель прагне отримати результат, який якомога точніше відповідає цільовому.
Наприклад, модель ШІ для прогнозування цін на житло, навчена на історичних даних про нерухомість у певному регіоні, може містити ваги для таких ознак, як кількість спалень і ванних кімнат, окремий чи напівокремий будинок, наявність паркувального місця, гаража тощо.
Зрештою, ваги, які модель надає кожній із цих характеристик, відображають, наскільки вони впливають на вартість нерухомості на основі відповідного набору даних.
Цю статтю регулярно оновлюють новою інформацією.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.