Непрозрачная рекуррентность и другие термины об ИИ, которые вам, вероятно, стоит знать
ИИ переписывает мир и одновременно изобретает совершенно новый язык, чтобы описать, как именно он это делает. В эти дни достаточно присутствовать на любой встрече по поводу продукта, презентации или панельной дискуссии, и вы услышите, как люди бросаются терминами LLM, RAG, RLHF — а с прошлой недели ещё и такими выражениями, как «непрозрачная рекуррентность» — методом рассуждения в новой модели OpenAI Astra, который встревожил исследователей безопасности ИИ. Терминология меняется настолько стремительно, что даже очень умные люди в мире технологий начинают чувствовать себя немного неуверенно.
Этот глоссарий — наша попытка это исправить: здесь собраны простые определения терминов ИИ, с которыми вы, скорее всего, столкнётесь, — независимо от того, создаёте ли вы продукты на основе этих технологий, инвестируете в них или просто пытаетесь не отставать, читая TechCrunch или слушая тематические подкасты. Мы регулярно обновляем его по мере развития отрасли, так что считайте этот материал живым документом — во многом подобно описываемым в нём системам ИИ.
AGI
Искусственный общий интеллект, или AGI, — расплывчатый термин. Но обычно под ним понимают ИИ, который превосходит среднего человека во многих, если не в большинстве, задач. Генеральный директор OpenAI Сэм Альтман однажды описал AGI как «эквивалент обычного человека, которого можно было бы нанять в качестве коллеги». Тем временем устав OpenAI определяет AGI как «высокоавтономные системы, превосходящие людей в большинстве экономически значимых видов деятельности». Понимание AGI в Google DeepMind немного отличается от этих двух определений: лаборатория считает AGI «ИИ, который как минимум не уступает людям в большинстве когнитивных задач». Запутались? Не беспокойтесь — эксперты, находящиеся на переднем крае исследований ИИ, тоже не до конца понимают, что это такое.
ИИ-агент
ИИ-агент — это инструмент, использующий технологии ИИ для выполнения от вашего имени серии задач, выходящих за рамки возможностей обычного ИИ-чат-бота, — например, оформления расходов, бронирования билетов или столика в ресторане и даже написания и обслуживания кода. Однако, как мы уже объясняли ранее, в этой новой области задействовано множество компонентов, поэтому для разных людей «ИИ-агент» может означать разные вещи. Инфраструктура для реализации предполагаемых возможностей таких систем также всё ещё создаётся. Но базовая концепция подразумевает автономную систему, которая может использовать несколько ИИ-систем для выполнения многоэтапных задач.
Конечные точки API
Представьте конечные точки API как «кнопки» на задней стороне программного продукта, которые другие программы могут нажимать, чтобы заставить его что-то делать. Разработчики используют эти интерфейсы для создания интеграций — например, чтобы одно приложение могло получать данные из другого или чтобы ИИ-агент мог напрямую управлять сторонними сервисами без ручного управления каждым интерфейсом со стороны человека. У большинства устройств умного дома и подключённых платформ есть такие скрытые кнопки, даже если обычные пользователи никогда их не видят и не взаимодействуют с ними. По мере того как ИИ-агенты становятся более функциональными, они всё чаще способны самостоятельно находить и использовать эти конечные точки, открывая широкие — а иногда и неожиданные — возможности для автоматизации.
Цепочка рассуждений
На простой вопрос человеческий мозг может ответить, почти не задумываясь, — например: «Какое животное выше — жираф или кошка?» Но во многих случаях для получения правильного ответа вам понадобятся ручка и бумага, поскольку нужно выполнить промежуточные шаги. Например, если у фермера есть куры и коровы, а всего у них 40 голов и 120 ног, возможно, вам придётся записать простое уравнение, чтобы получить ответ (20 кур и 20 коров).
В контексте ИИ рассуждение по принципу цепочки мыслей для больших языковых моделей означает разбиение задачи на более мелкие промежуточные шаги для повышения качества конечного результата. Обычно получение ответа занимает больше времени, но вероятность правильного ответа выше, особенно в задачах на логику или программирование. Рассуждающие модели создаются на основе традиционных больших языковых моделей и оптимизируются для пошагового мышления с помощью обучения с подкреплением.
(См.: Большая языковая модель)
Агенты для программирования
Это более конкретная разновидность «ИИ-агента», то есть программы, способной самостоятельно, шаг за шагом, выполнять действия для достижения цели. Агент для программирования — это специализированная версия, применяемая в разработке программного обеспечения. Вместо того чтобы просто предлагать код, который человек должен проверить и вставить, агент для программирования может автономно писать, тестировать и отлаживать код, выполняя итеративную работу методом проб и ошибок, которая обычно занимает значительную часть рабочего дня разработчика. Такие агенты могут работать со всей кодовой базой, находить ошибки, запускать тесты и вносить исправления при минимальном контроле со стороны человека. Представьте очень быстрого стажёра, который никогда не спит и не теряет концентрации, — хотя, как и в случае с любым стажёром, человек всё равно должен проверить его работу.
Вычислительные ресурсы
Хотя это несколько многозначный термин, под вычислительными ресурсами обычно понимают важную вычислительную мощность, позволяющую моделям ИИ работать. Этот тип обработки данных обеспечивает функционирование отрасли ИИ, давая ей возможность обучать и развёртывать мощные модели. Термин часто используется как сокращение для обозначения типов оборудования, обеспечивающего вычислительную мощность, — например, графических процессоров, центральных процессоров, тензорных процессоров и других видов инфраструктуры, составляющих основу современной отрасли ИИ.
Глубокое обучение
Разновидность самообучающегося машинного обучения, в которой алгоритмы ИИ создаются на основе многослойной структуры искусственной нейронной сети (ANN). Это позволяет им выявлять более сложные взаимосвязи по сравнению с более простыми системами на основе машинного обучения, такими как линейные модели или деревья решений. Структура алгоритмов глубокого обучения вдохновлена взаимосвязанными путями нейронов в человеческом мозге.
Модели ИИ на основе глубокого обучения способны самостоятельно выявлять важные характеристики данных, вместо того чтобы требовать от инженеров определить эти признаки заранее. Такая структура также поддерживает алгоритмы, которые могут учиться на ошибках и посредством повторения и корректировки улучшать собственные результаты. Однако для получения хороших результатов системам глубокого обучения требуется много точек данных (миллионы и более). Кроме того, их обучение обычно занимает больше времени по сравнению с более простыми алгоритмами машинного обучения, поэтому затраты на разработку, как правило, выше.
(См.: Нейронная сеть)
Диффузия
Диффузия — технология, лежащая в основе многих моделей ИИ, генерирующих изображения, музыку и текст. Вдохновлённые физикой, диффузионные системы постепенно «разрушают» структуру данных — например, фотографий, песен и так далее — добавляя шум, пока от исходной структуры ничего не остаётся. В физике диффузия происходит самопроизвольно и необратимо: сахар, растворившийся в кофе, нельзя восстановить в форме кубика. Но диффузионные системы в ИИ стремятся научиться своего рода процессу «обратной диффузии», чтобы восстанавливать разрушенные данные и получать возможность извлекать их из шума.
Дистилляция
Дистилляция — это метод извлечения знаний из большой модели ИИ с использованием модели «учитель — ученик». Разработчики отправляют запросы модели-учителю и записывают результаты. Иногда ответы сравниваются с набором данных, чтобы проверить их точность. Затем эти результаты используются для обучения модели-ученика, которую обучают имитировать поведение учителя.
Дистилляцию можно использовать для создания меньшей и более эффективной модели на основе крупной модели с минимальными потерями при дистилляции. Вероятно, именно так OpenAI разработала GPT-4 Turbo — более быструю версию GPT-4.
Хотя все компании в сфере ИИ используют дистилляцию внутри своих организаций, некоторые из них могли применять её и для того, чтобы догнать передовые модели. Дистилляция от конкурента обычно нарушает условия использования API и чат-ассистентов на базе ИИ.
Тонкая настройка
Так называют дополнительное обучение модели ИИ для оптимизации её производительности в более конкретной задаче или области, которая ранее не была основным направлением обучения, — обычно за счёт подачи новых специализированных (то есть ориентированных на конкретную задачу) данных.
Многие стартапы в сфере ИИ берут большие языковые модели за основу для создания коммерческого продукта, но стремятся повысить их полезность для конкретной отрасли или задачи, дополняя предыдущие циклы обучения тонкой настройкой на основе собственных отраслевых знаний и опыта.
(См.: Большая языковая модель [LLM])
GAN
GAN, или генеративно-состязательная сеть, — это тип структуры машинного обучения, лежащий в основе некоторых важных достижений генеративного ИИ в области создания реалистичных данных, включая (но не ограничиваясь ими) инструменты для создания дипфейков. GAN предполагает использование пары нейронных сетей, одна из которых опирается на данные обучения для создания результата, передаваемого другой модели для оценки.
По сути, эти две модели запрограммированы на то, чтобы превзойти друг друга. Генератор пытается провести свой результат мимо дискриминатора, а дискриминатор старается обнаружить искусственно созданные данные. Такое структурированное состязание позволяет оптимизировать результаты ИИ и сделать их более реалистичными без дополнительного вмешательства человека. Однако GAN лучше всего работают в более узких областях применения (например, при создании реалистичных фотографий или видео), а не в ИИ общего назначения.
Галлюцинация
Галлюцинация — предпочтительный в индустрии ИИ термин для обозначения случаев, когда модели ИИ что-то выдумывают, то есть буквально генерируют неверную информацию. Очевидно, это большая проблема для качества ИИ.
Галлюцинации приводят к появлению вводящих в заблуждение результатов генеративного ИИ и могут повлечь реальные риски — с потенциально опасными последствиями (например, если в ответ на медицинский запрос система выдаст вредный совет).
Считается, что проблема выдумывания информации ИИ возникает вследствие пробелов в данных обучения. Галлюцинации способствуют переходу к всё более специализированным и/или вертикальным моделям ИИ — то есть отраслевым ИИ, которым требуется более узкая экспертиза, — как способу снизить вероятность пробелов в знаниях и уменьшить риски распространения дезинформации.
Инференс
Инференс — это процесс запуска модели ИИ. Иными словами, модель начинает делать прогнозы или выводы на основе ранее увиденных данных. Важно отметить, что инференс невозможен без обучения: модель должна выучить закономерности в наборе данных, прежде чем сможет эффективно экстраполировать их на основе этих данных.
Инференс могут выполнять разные типы оборудования — от процессоров смартфонов до мощных графических процессоров и специально разработанных ускорителей ИИ. Но не все они одинаково хорошо запускают модели. Очень крупным моделям потребовалась бы целая вечность для построения прогнозов на ноутбуке по сравнению с облачным сервером, оснащённым высокопроизводительными чипами для ИИ.
[См.: Обучение]
Большая языковая модель (LLM)
Большие языковые модели, или LLM, — это модели ИИ, используемые популярными ИИ-ассистентами, такими как ChatGPT, Claude, Gemini от Google, ИИ Llama от Meta, Microsoft Copilot или Le Chat от Mistral. Когда вы общаетесь с ИИ-ассистентом, вы взаимодействуете с большой языковой моделью, которая обрабатывает ваш запрос напрямую или с помощью различных доступных инструментов, таких как просмотр веб-страниц или интерпретаторы кода.
LLM — это глубокие нейронные сети, состоящие из миллиардов числовых параметров (или весов, см. ниже), которые изучают взаимосвязи между словами и фразами и создают представление о языке — своего рода многомерную карту слов.
Эти модели создаются посредством кодирования закономерностей, обнаруженных в миллиардах книг, статей и расшифровок. Когда вы подаёте запрос LLM, модель генерирует наиболее вероятную закономерность, соответствующую запросу.
(См.: Нейронная сеть)
Кэш памяти
Кэш памяти — это важный процесс, ускоряющий инференс (то есть процесс, посредством которого ИИ формирует ответ на запрос пользователя). По сути, кэширование — это метод оптимизации, призванный сделать инференс более эффективным. ИИ, очевидно, работает благодаря интенсивным математическим вычислениям, и каждый раз, когда эти вычисления выполняются, они требуют дополнительных ресурсов. Кэширование призвано сократить количество вычислений, которые приходится выполнять модели, сохраняя определённые вычисления для будущих запросов и операций пользователей. Существует несколько видов кэширования памяти, однако одним из наиболее известных является KV-кэширование (кэширование ключей и значений). KV-кэширование работает в моделях на основе трансформеров и повышает эффективность, обеспечивая более быстрые результаты за счёт сокращения времени (и объёма алгоритмической работы), необходимого для генерации ответов на вопросы пользователей.
(См.: Инференс)
Протокол контекста модели (MCP)
Протокол контекста модели, или MCP, — это открытый стандарт, позволяющий моделям ИИ подключаться к внешним инструментам и данным — вашим файлам, базам данных или приложениям вроде Slack и Google Drive — без необходимости создавать для каждой отдельной пары собственный коннектор. Представьте его как USB-C для ИИ. Anthropic представила MCP в 2024 году, а позднее передала его Linux Foundation; с тех пор его приняли OpenAI, Google и Microsoft, что сделало его одним из наиболее быстро распространяющихся стандартов за всю недавнюю историю ИИ.
Смесь экспертов (MoE)
Смесь экспертов — это архитектура модели, в которой нейронная сеть разделяется на множество небольших специализированных подсетей, или «экспертов», и для каждой конкретной задачи активируется лишь несколько из них. Вместо того чтобы направлять каждый запрос через всю модель — словно созывать весь офис для ответа на каждый вопрос, — у модели MoE есть встроенный «маршрутизатор», который выбирает подходящих специалистов для конкретной работы. Это позволяет создавать огромные модели, которые остаются относительно быстрыми и дешёвыми в эксплуатации, поскольку в каждый момент работает лишь часть сети. Модель Mixtral от Mistral AI — известный пример; также широко считается, что новые модели GPT от OpenAI используют некоторую версию этого подхода, хотя компания официально этого никогда не подтверждала.
(См.: Нейронная сеть, глубокое обучение)
Нейронная сеть
Нейронная сеть — это многослойная алгоритмическая структура, лежащая в основе глубокого обучения и, в более широком смысле, всего бума генеративных ИИ-инструментов, последовавшего за появлением больших языковых моделей.
Хотя идея черпать вдохновение в плотно взаимосвязанных структурах человеческого мозга при создании алгоритмов обработки данных восходит ещё к 1940-м годам, именно гораздо более позднее распространение графических процессоров (GPU) благодаря индустрии видеоигр по-настоящему раскрыло потенциал этой теории. Эти чипы оказались хорошо приспособлены для обучения алгоритмов с гораздо большим количеством слоёв, чем это было возможно на ранних этапах, — благодаря чему системы ИИ на основе нейронных сетей смогли добиться значительно более высокой эффективности во многих областях, включая распознавание речи, автономную навигацию и разработку лекарств.
(См.: Большая языковая модель [LLM])
Нейронный язык
Гипотетический наихудший сценарий, при котором модель рассуждает исключительно во внутренних числовых представлениях, а не на понятном человеку языке, превращая своё мышление в полностью непрозрачный «чёрный ящик». Сегодня ни одна выпущенная модель так не работает: OpenAI заявила, что её модель Astra (выпущенная в сентябре 2026 года и примечательная ранним использованием метода рассуждения, называемого «непрозрачной рекуррентностью») сохраняет понятную цепочку рассуждений, а также отвергла сравнения с нейронным языком. Однако исследователи безопасности указывают на использование Astra непрозрачной рекуррентности — её определение приведено ниже — как на реальный первый шаг в этом направлении. Именно поэтому термин получил широкое распространение после публикаций о запуске Astra.
Непрозрачная рекуррентность
Непрозрачная рекуррентность — это ситуация, когда модель ИИ многократно пропускает один и тот же запрос через свои внутренние слои вместо пошагового рассуждения на обычном языке. Это эффективнее: небольшие модели могут превосходить свои ожидаемые возможности, используя меньше вычислительных ресурсов, — но при этом оставляет гораздо меньше понятных следов, чем обычная цепочка рассуждений (тот непрерывный комментарий, который вы видите после просьбы к чат-боту о помощи). Это беспокоит исследователей безопасности, поскольку такие журналы — важный инструмент для выявления некорректного поведения, а данный метод может значительно усложнить такой контроль.
(См.: Цепочка рассуждений)
Открытый исходный код
Открытым исходным кодом называют программное обеспечение — или, всё чаще, модели ИИ, — исходный код которых общедоступен для использования, изучения или изменения. В мире ИИ ярким примером является семейство моделей Llama от Meta; историческим аналогом в сфере операционных систем служит Linux. Подходы с открытым исходным кодом позволяют исследователям, разработчикам и компаниям по всему миру строить свои решения на основе работы друг друга, ускоряя прогресс и обеспечивая независимый аудит безопасности, который закрытые системы не могут легко предоставить. Закрытый исходный код означает, что код является частным: продуктом можно пользоваться, но нельзя увидеть, как он работает, — так обстоит дело с моделями GPT от OpenAI. Это различие стало одним из главных предметов споров в индустрии ИИ.
Параллелизация
Параллелизация означает выполнение множества действий одновременно, а не одного за другим, — например, когда 10 сотрудников одновременно работают над разными частями проекта, вместо того чтобы один сотрудник последовательно выполнял всю работу. В ИИ параллелизация имеет фундаментальное значение как для обучения, так и для инференса: современные графические процессоры специально разработаны для выполнения тысяч вычислений параллельно, что является одной из главных причин, по которым они стали аппаратной основой отрасли. По мере усложнения систем ИИ и увеличения размеров моделей возможность распределять работу между множеством чипов и машин стала одним из важнейших факторов, определяющих скорость и экономичность создания и развёртывания моделей. Исследования более эффективных стратегий параллелизации теперь сами по себе стали отдельной областью.
RAMageddon
RAMageddon — это забавный новый термин для обозначения не слишком забавной тенденции, охватывающей технологическую отрасль: постоянно усиливающегося дефицита оперативной памяти, или чипов RAM, которые обеспечивают работу практически всех технологических продуктов, используемых нами в повседневной жизни. По мере расцвета индустрии ИИ крупнейшие технологические компании и лаборатории ИИ — все стремящиеся создать самый мощный и эффективный ИИ — закупают так много оперативной памяти для своих дата-центров, что для остальных её почти не остаётся. А этот дефицит предложения означает, что оставшаяся память становится всё дороже.
Это затрагивает такие отрасли, как игровая индустрия (где крупным компаниям пришлось повысить цены на консоли, поскольку найти чипы памяти для устройств стало сложнее), потребительская электроника (где дефицит памяти может привести к крупнейшему за более чем десятилетие падению поставок смартфонов) и корпоративные вычисления в целом (поскольку компании не могут получить достаточно оперативной памяти для собственных дата-центров). Ожидается, что рост цен прекратится только после окончания этого кошмарного дефицита, но, к сожалению, пока не так много признаков того, что это произойдёт в ближайшее время.
Рекуррентная глубина
Это более «техническое» название того же базового метода, что и непрозрачная рекуррентность (многократное пропускание запроса через слои модели вместо последовательного рассуждения на языке). СМИ используют эти два термина почти взаимозаменяемо, поэтому мы включили оба, хотя «рекуррентная глубина» — инженерный термин, а «непрозрачная рекуррентность» подчёркивает проблему безопасности.
(См. Непрозрачная рекуррентность, цепочка рассуждений.)
Рекурсивное самосовершенствование
Как и AGI, рекурсивное самосовершенствование — это порог, определяющий, насколько умным может стать ИИ и насколько мало он может зависеть от людей. В сценарии RSI модели ИИ начинают улучшать себя без вмешательства человека, что приводит к резкому ускорению их возможностей и автономности. В некоторых версиях этого сценария такой момент становится катастрофическим и напоминает сингулярность — момент, когда модели ИИ становятся невосприимчивыми к внешнему вмешательству. Но RSI также обозначает базовую способность: сможет ли модель ИИ спроектировать собственного преемника? — что значительно облегчает инженерам попытки её создать. Ряд недавних стартапов в сфере ИИ поставил целью создание рекурсивно самосовершенствующихся моделей, но большинство из них отвергает апокалиптические последствия, представляя RSI просто как следующий рубеж исследований.
Обучение с подкреплением
Обучение с подкреплением — это способ обучения ИИ, при котором система учится, пробуя разные действия и получая вознаграждение за правильные ответы, — примерно как дрессировка любимого питомца с помощью лакомств, только «питомец» в данном случае — нейронная сеть, а «лакомство» — математический сигнал, указывающий на успех. В отличие от обучения с учителем, при котором модель обучается на фиксированном наборе размеченных примеров, обучение с подкреплением позволяет модели исследовать окружающую среду, предпринимать действия и непрерывно обновлять своё поведение на основе получаемой обратной связи. Этот подход оказался особенно эффективным для обучения ИИ играм, управления роботами и, в последнее время, улучшения способности больших языковых моделей рассуждать. Такие методы, как обучение с подкреплением на основе обратной связи от людей, или RLHF, теперь играют центральную роль в тонкой настройке моделей ведущими лабораториями ИИ, чтобы сделать их более полезными, точными и безопасными.
Токен
Когда речь идёт о коммуникации человека и машины, возникают очевидные сложности: люди общаются на человеческом языке, тогда как программы ИИ выполняют задачи посредством сложных алгоритмических процессов, основанных на данных. Токены соединяют эти два мира: это базовые строительные блоки коммуникации человека и ИИ, представляющие дискретные фрагменты данных, обработанные или созданные LLM. Они создаются в процессе, называемом токенизацией, который разбивает исходный текст на небольшие единицы, способные восприниматься языковой моделью, подобно тому как компилятор переводит человеческий язык в двоичный код, понятный компьютеру. В корпоративной среде токены также определяют стоимость: большинство компаний в сфере ИИ взимают плату за использование LLM из расчёта на токен, то есть чем больше компания использует модель, тем больше она платит.
Пропускная способность по токенам
Итак, токены — это небольшие фрагменты текста, часто части слов, а не целые слова, на которые языковые модели ИИ разбивают язык перед обработкой; для понимания рабочих нагрузок ИИ они примерно аналогичны «словам». Пропускная способность показывает, какой объём можно обработать за определённый период, поэтому пропускная способность по токенам — это фактически мера того, какой объём работы ИИ система может выполнять одновременно. Высокая пропускная способность по токенам — ключевая цель команд, занимающихся инфраструктурой ИИ, поскольку от неё зависит, сколько пользователей модель может обслуживать одновременно и насколько быстро каждый из них получает ответ. Исследователь ИИ Андрей Карпати рассказывал, что испытывает тревогу, когда его подписки на ИИ простаивают, — это напоминает ему о чувствах, которые он испытывал в аспирантуре, когда дорогое компьютерное оборудование использовалось не полностью. Это хорошо передаёт, почему максимизация пропускной способности по токенам стала своего рода навязчивой идеей в отрасли.
Обучение
Разработка ИИ на основе машинного обучения предполагает процесс, известный как обучение. Если говорить просто, это подача данных, чтобы модель могла изучать закономерности и генерировать полезные результаты. По сути, это процесс, в котором система реагирует на характеристики данных, что позволяет ей адаптировать результаты под поставленную цель — будь то распознавание изображений кошек или создание хайку по запросу.
Обучение может быть дорогостоящим, поскольку требует огромного количества входных данных, причём необходимый объём постоянно растёт. Поэтому гибридные подходы, например тонкая настройка ИИ на основе правил с использованием целевых данных, помогают контролировать затраты, не начиная всё полностью с нуля.
[См.: Инференс]
Трансферное обучение
Метод, при котором ранее обученная модель ИИ используется как отправная точка для разработки новой модели под другую, но обычно связанную задачу, что позволяет повторно применять знания, полученные в предыдущих циклах обучения.
Трансферное обучение позволяет повысить эффективность и сократить затраты за счёт ускорения разработки модели. Оно также может быть полезно, когда объём данных для задачи, под которую разрабатывается модель, несколько ограничен. Однако важно отметить, что у этого подхода есть ограничения. Моделям, которые используют трансферное обучение для получения обобщённых возможностей, вероятно, потребуется обучение на дополнительных данных, чтобы хорошо работать в своей целевой области.
(См.: Тонкая настройка)
Ошибка на валидационной выборке
Ошибка на валидационной выборке — это число, показывающее, насколько хорошо модель ИИ обучается, причём чем оно ниже, тем лучше. Исследователи внимательно отслеживают этот показатель как своего рода табель успеваемости в реальном времени, используя его для принятия решений о том, когда остановить обучение, изменить гиперпараметры или проверить возможную проблему. Одна из ключевых проблем, которую он помогает выявить, — переобучение: состояние, при котором модель запоминает данные обучения, вместо того чтобы по-настоящему изучать закономерности, которые можно обобщить на новые ситуации. Представьте разницу между учеником, который действительно понимает материал, и тем, кто просто выучил прошлогодний экзамен: ошибка на валидационной выборке помогает понять, в кого превращается ваша модель.
Веса
Веса играют центральную роль в обучении ИИ, поскольку определяют, какое значение (или вес) придаётся различным признакам (или входным переменным) в данных, используемых для обучения системы, — тем самым формируя результат работы модели ИИ.
Иными словами, веса — это числовые параметры, определяющие, что является наиболее значимым в наборе данных для конкретной задачи обучения. Они выполняют свою функцию посредством умножения входных данных. Обучение модели обычно начинается со случайно назначенных весов, но по мере развития процесса веса корректируются, поскольку модель стремится получить результат, который в большей степени соответствует целевому.
Например, модель ИИ для прогнозирования цен на жильё, обученная на исторических данных о недвижимости в определённом регионе, может включать веса для таких признаков, как количество спален и ванных комнат, отдельное или сблокированное расположение дома, наличие парковки, гаража и так далее.
В конечном итоге веса, которые модель присваивает каждому из этих входных параметров, отражают степень их влияния на стоимость недвижимости с учётом данного набора данных.
Эта статья регулярно обновляется с учётом новой информации.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.