Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Непрозрачна рекурентност и други термини за ИИ, които вероятно трябва да знаете

ИИ пренаписва света и същевременно изобретява изцяло нов език, с който да описва как го прави. Влезте в която и да е продуктова среща, презентация или дискусия в наши дни и ще чуете хората да подхвърлят LLM, RAG, RLHF — а от миналата седмица и термини като „непрозрачна рекурентност“ — техниката за разсъждение в новия модел Astra на OpenAI, която разтревожи изследователите в областта на безопасността на ИИ. Речникът се променя достатъчно бързо, за да накара дори много умни хора в технологичния свят да се почувстват малко несигурни.

Този речник е нашият опит да поправим това: ясни определения на разбираем език за термините от областта на ИИ, които най-вероятно ще срещнете — независимо дали разработвате с тези технологии, инвестирате в тях или просто се опитвате да следите новостите, като четете TechCrunch или слушате свързани подкасти. Актуализираме го редовно с развитието на областта, така че го приемайте като жив документ — подобно на системите за ИИ, които описва.


AGI

Изкуственият общ интелект, или AGI, е неясен термин. Обикновено обаче той се отнася до ИИ, който е по-способен от средностатистическия човек в много, ако не и в повечето задачи. Главният изпълнителен директор на OpenAI Сам Алтман веднъж описа AGI като „еквивалент на средностатистически човек, когото можете да наемете за колега“. Междувременно уставът на OpenAI определя AGI като „силно автономни системи, които превъзхождат хората в повечето икономически ценни дейности“. Разбирането на Google DeepMind се различава леко от тези две определения; лабораторията разглежда AGI като „ИИ, който е поне толкова способен, колкото хората, в повечето когнитивни задачи“. Объркани сте? Няма повод за притеснение — такова е положението и с експертите, намиращи се в авангарда на изследванията в областта на ИИ.

ИИ агент

ИИ агентът е инструмент, който използва технологии за ИИ, за да изпълнява поредица от задачи от ваше име — отвъд възможностите на по-базов чатбот с ИИ — като подаване на отчети за разходи, резервиране на билети или маса в ресторант и дори писане и поддръжка на код. Както вече сме обяснявали, в това нововъзникващо пространство има много взаимосвързани елементи, така че „ИИ агент“ може да означава различни неща за различните хора. Все още се изгражда и необходимата инфраструктура за реализиране на предвидените му възможности. Основната концепция обаче предполага автономна система, която може да използва множество ИИ системи, за да изпълнява задачи на няколко стъпки.

API крайни точки

Представете си API крайните точки като „бутони“ на гърба на даден софтуер, които други програми могат да натиснат, за да го накарат да извърши нещо. Разработчиците използват тези интерфейси, за да изграждат интеграции — например да позволят на едно приложение да извлича данни от друго или да дадат възможност на ИИ агент да управлява директно услуги на трети страни, без човек ръчно да работи с всеки интерфейс. Повечето умни домашни устройства и свързани платформи разполагат с такива скрити бутони, дори обикновените потребители никога да не ги виждат или използват. С нарастването на възможностите на ИИ агентите те все по-често могат сами да намират и използват тези крайни точки, откривайки мощни — а понякога и неочаквани — възможности за автоматизация.

Верига на мисълта

Когато получи прост въпрос, човешкият мозък може да отговори, без дори да се замисля особено — например „кое животно е по-високо, жирафът или котката?“. В много случаи обаче ви трябват химикал и хартия, за да стигнете до правилния отговор, защото има междинни стъпки. Например, ако един фермер има кокошки и крави, които общо имат 40 глави и 120 крака, може да се наложи да запишете просто уравнение, за да стигнете до отговора (20 кокошки и 20 крави).

В контекста на ИИ разсъждението по верига на мисълта за големите езикови модели означава разделяне на даден проблем на по-малки междинни стъпки с цел подобряване на качеството на крайния резултат. Обикновено получаването на отговор отнема повече време, но е по-вероятно той да бъде правилен, особено при задачи, свързани с логика или програмиране. Моделите за разсъждение се разработват на основата на традиционни големи езикови модели и се оптимизират за мислене по верига на мисълта благодарение на подсилващото обучение.

(Вижте: Голям езиков модел)

Агенти за програмиране

Това е по-специфична концепция от „ИИ агент“, който представлява програма, способна да предприема действия самостоятелно, стъпка по стъпка, за да постигне дадена цел. Агентът за програмиране е специализирана версия, приложена към разработката на софтуер. Вместо просто да предлага код, който човек да прегледа и постави, агентът за програмиране може автономно да пише, тества и отстранява грешки в код, като изпълнява итеративната работа чрез проби и грешки, която обикновено заема целия ден на разработчика. Тези агенти могат да работят в цели кодови бази, да откриват грешки, да изпълняват тестове и да внедряват поправки с минимален човешки надзор. Представете си, че наемате много бърз стажант, който никога не спи и никога не губи концентрация — макар че, както при всеки стажант, човек все пак трябва да преглежда работата му.

Изчислителни ресурси

Макар да е донякъде многозначен термин, „изчислителни ресурси“ обикновено се отнася до жизненоважната изчислителна мощ, която позволява на моделите за ИИ да работят. Този тип обработка захранва индустрията за ИИ, като ѝ дава възможност да обучава и внедрява своите мощни модели. Терминът често е съкратено обозначение за видовете хардуер, които осигуряват изчислителната мощ — например графични процесори, централни процесори, тензорни процесори и други форми на инфраструктура, които са в основата на съвременната индустрия за ИИ.

Дълбоко обучение

Подмножество на самоусъвършенстващото се машинно обучение, при което алгоритмите за ИИ са проектирани с многослойна структура от изкуствени невронни мрежи (ANN). Това им позволява да откриват по-сложни зависимости в сравнение с по-прости системи, базирани на машинно обучение, като линейни модели или дървета на решенията. Структурата на алгоритмите за дълбоко обучение е вдъхновена от взаимосвързаните пътища на невроните в човешкия мозък.

Моделите за ИИ с дълбоко обучение могат сами да идентифицират важните характеристики в данните, вместо човешки инженери да трябва да определят тези характеристики. Структурата също така поддържа алгоритми, които могат да се учат от грешките и чрез процес на повторение и корекции да подобряват собствените си резултати. Системите за дълбоко обучение обаче се нуждаят от много точки от данни, за да дадат добри резултати (милиони или повече). Освен това обикновено обучението им отнема повече време в сравнение с по-простите алгоритми за машинно обучение — затова разходите за разработка обикновено са по-високи.

(Вижте: Невронна мрежа)

Дифузия

Дифузията е технологията в основата на много модели за ИИ, които генерират изображения, музика и текст. Вдъхновени от физиката, дифузионните системи бавно „разрушават“ структурата на данните — например снимки, песни и други — като добавят шум, докато не остане нищо. Във физиката дифузията е спонтанна и необратима — захарта, разтворила се в кафето, не може да бъде възстановена във формата на кубче. Дифузионните системи в ИИ обаче се стремят да се научат на своеобразен процес на „обратна дифузия“, за да възстановяват унищожените данни, придобивайки способността да извличат данни от шума.

Дистилация

Дистилацията е техника за извличане на знания от голям ИИ модел чрез модел „учител-ученик“. Разработчиците изпращат заявки към модел учител и записват резултатите. Понякога отговорите се сравняват с набор от данни, за да се провери колко са точни. След това тези резултати се използват за обучение на модела ученик, който се обучава да апроксимира поведението на учителя.

Дистилацията може да се използва за създаване на по-малък и по-ефективен модел на базата на по-голям модел с минимална загуба при дистилацията. Вероятно именно така OpenAI е разработила GPT-4 Turbo — по-бърза версия на GPT-4.

Макар всички компании за ИИ да използват дистилация вътрешно, тя може да е била използвана и от някои компании за ИИ, за да догонят водещите модели. Дистилацията от конкурент обикновено нарушава условията за използване на API за ИИ и чат асистенти.

Фино дообучаване

Това се отнася до допълнително обучение на ИИ модел с цел оптимизиране на представянето му за по-специфична задача или област от тази, която досега е била фокус на обучението му — обикновено чрез подаване на нови, специализирани (т.е. ориентирани към конкретна задача) данни. 

Много стартъпи в областта на ИИ използват големите езикови модели като отправна точка за създаване на търговски продукт, но се стремят да увеличат полезността им за даден сектор или задача, като допълват предишните цикли на обучение с фино дообучаване на базата на собствените си специфични за областта знания и експертиза.

(Вижте: Голям езиков модел [LLM])

GAN

GAN, или генеративна състезателна мрежа, е вид рамка за машинно обучение, която стои в основата на някои важни разработки в генеративния ИИ, свързани със създаването на реалистични данни — включително, но не само, инструменти за дийпфейк. GAN включва използването на двойка невронни мрежи, едната от които използва данните си за обучение, за да генерира резултат, който се подава на другия модел за оценка.

Двата модела по същество са програмирани да се опитват да надминат един друг. Генераторът се опитва да прокара резултата си покрай дискриминатора, докато дискриминаторът се стреми да открие изкуствено генерираните данни. Това структурирано съревнование може да оптимизира резултатите на ИИ, за да бъдат по-реалистични, без да е необходима допълнителна човешка намеса. GAN обаче работят най-добре при по-тесни приложения (като създаване на реалистични снимки или видеоклипове), а не при ИИ с общо предназначение.

Халюцинация

Халюцинация е предпочитаният от индустрията за ИИ термин за случаите, когато моделите за ИИ си измислят неща — буквално генерират невярна информация. Очевидно това е огромен проблем за качеството на ИИ. 

Халюцинациите водят до резултати от генеративния ИИ, които могат да бъдат подвеждащи и дори да създадат реални рискове — с потенциално опасни последици (например при здравен въпрос, на който е даден вреден медицински съвет).

Смята се, че проблемът с измислянето на информация от ИИ възниква вследствие на пропуски в данните за обучение. Халюцинациите допринасят за стремежа към все по-специализирани и/или вертикални модели за ИИ — т.е. ИИ системи, специфични за дадена област и изискващи по-тясна експертиза — като начин за намаляване на вероятността от пропуски в знанията и ограничаване на рисковете от дезинформация.

Инференция

Инференцията е процесът на изпълнение на ИИ модел. Това е моментът, в който моделът се оставя да прави прогнози или да извлича заключения от вече видени данни. За да сме ясни, инференция не може да има без обучение; моделът трябва да научи закономерности в даден набор от данни, преди да може ефективно да екстраполира въз основа на тези данни за обучение.

Много видове хардуер могат да извършват инференция — от процесори за смартфони до мощни графични процесори и специално проектирани ускорители за ИИ. Но не всички могат да изпълняват моделите еднакво добре. На много големите модели би им отнело цяла вечност да правят прогнози например на лаптоп в сравнение с облачен сървър с висок клас чипове за ИИ.

[Вижте: Обучение]

Голям езиков модел (LLM)

Големите езикови модели, или LLM, са ИИ моделите, използвани от популярни ИИ асистенти като ChatGPT, Claude, Gemini на Google, ИИ Llama на Meta, Microsoft Copilot или Le Chat на Mistral. Когато разговаряте с ИИ асистент, взаимодействате с голям езиков модел, който обработва заявката ви директно или с помощта на различни налични инструменти, като сърфиране в мрежата или интерпретатори на код.

LLM са дълбоки невронни мрежи, съставени от милиарди числови параметри (или тегла, вижте по-долу), които научават връзките между думите и фразите и създават представяне на езика — своеобразна многомерна карта на думите.

Тези модели се създават чрез кодиране на закономерностите, които откриват в милиарди книги, статии и стенограми. Когато подадете подкана към LLM, моделът генерира най-вероятната закономерност, която съответства на подканата.

(Вижте: Невронна мрежа)

Кеш на паметта

Кешът на паметта се отнася до важен процес, който ускорява инференцията (процеса, чрез който ИИ работи, за да генерира отговор на заявка от потребител). По същество кеширането е техника за оптимизация, предназначена да направи инференцията по-ефективна. Очевидно ИИ се задвижва от високоскоростни математически изчисления и всеки път, когато те се извършват, се изразходва допълнителна енергия. Кеширането има за цел да намали броя на изчисленията, които моделът трябва да извърши, като запазва определени изчисления за бъдещи потребителски заявки и операции. Съществуват различни видове кеширане на паметта, макар че един от по-известните е KV кеширането (или кеширането на ключ-стойност). KV кеширането работи при модели, базирани на трансформъри, и увеличава ефективността, като осигурява по-бързи резултати чрез намаляване на времето (и алгоритмичния труд), необходимо за генериране на отговори на потребителски въпроси.   

(Вижте: Инференция)  

Протокол за контекста на модела (MCP)

Протоколът за контекста на модела, или MCP, е отворен стандарт, който позволява на ИИ моделите да се свързват с външни инструменти и данни — вашите файлове, бази данни или приложения като Slack и Google Drive — без разработчикът да създава персонализиран конектор за всяка отделна комбинация. Представете си го като USB-C порт за ИИ. Anthropic представи MCP през 2024 г., а по-късно го предаде на Linux Foundation. Оттогава той е приет от OpenAI, Google и Microsoft, което го превръща в един от най-бързо разпространяващите се стандарти в новата история на ИИ.

Смес от експерти (MoE)

Смесът от експерти е архитектура на модел, която разделя невронната мрежа на множество по-малки специализирани подмрежи, или „експерти“, и активира само няколко от тях за дадена задача. Вместо да насочва всяка заявка през целия модел — като да свикате целия си офис за всеки въпрос — моделът MoE разполага с вграден „рутер“, който избира точните специалисти за конкретната задача. Това позволява създаването на огромни модели, които остават сравнително бързи и евтини за работа, тъй като във всеки момент работи само част от мрежата. Моделът Mixtral на Mistral AI е добре познат пример; също така широко се смята, че по-новите GPT модели на OpenAI използват някаква версия на този подход, макар че компанията никога не го е потвърждавала официално.

(Вижте: Невронна мрежа, дълбоко обучение)

Невронна мрежа

Невронната мрежа представлява многослойна алгоритмична структура, която стои в основата на дълбокото обучение и, в по-широк смисъл, на целия бум от генеративни ИИ инструменти след появата на големите езикови модели. 

Макар идеята за използване на гъсто свързаните пътища на човешкия мозък като структурен модел за алгоритми за обработка на данни да датира още от 40-те години на миналия век, именно много по-скорошният възход на графичния хардуер (графичните процесори — GPU) чрез индустрията за видеоигри отключи истинския потенциал на тази теория. Тези чипове се оказаха подходящи за обучение на алгоритми с много повече слоеве, отколкото е било възможно в по-ранните епохи, като позволиха на ИИ системите, базирани на невронни мрежи, да постигнат значително по-добри резултати в множество области, включително разпознаване на глас, автономна навигация и разработване на лекарства.

(Вижте: Голям езиков модел [LLM])

Neuralese

Хипотетичен най-лош сценарий, при който моделът разсъждава изцяло чрез вътрешните си числови представяния, а не на разбираем за хората език, превръщайки мисловния си процес в пълна черна кутия. Днес нито един пуснат модел не работи по този начин — OpenAI заяви, че нейният модел Astra (пуснат през септември 2026 г. и отличаващ се с ранното използване на техниката за разсъждение „непрозрачна рекурентност“) запазва веригата на мисълта си разбираема и отхвърли сравненията с Neuralese. Изследователите в областта на безопасността обаче посочват използването на непрозрачна рекурентност от Astra — определението за нея е непосредствено по-долу — като реална първа стъпка в тази посока, поради което терминът получи широка популярност след публикациите около премиерата на Astra.

Непрозрачна рекурентност

Непрозрачна рекурентност има, когато ИИ модел многократно прекарва една и съща заявка през вътрешните си слоеве, вместо да разсъждава стъпка по стъпка на разбираем език. Това е по-ефективно — по-малките модели могат да постигат резултати над очакваното за размера си, използвайки по-малко изчислителни ресурси — но оставя значително по-малко четими следи от нормалната верига на мисълта (онзи текущ коментар, който виждате, след като поискате помощ от чатбот). Това тревожи изследователите в областта на безопасността, тъй като тези записи са ключов инструмент за откриване на неправомерно поведение — а тази техника може да направи надзора много по-труден.

(Вижте: Верига на мисълта)

Отворен код

Отвореният код се отнася до софтуер — или все по-често до ИИ модели — при който основният код е публично достъпен, така че всеки да може да го използва, инспектира или променя. В света на ИИ семейството модели Llama на Meta е виден пример; Linux е прочутият исторически паралел в областта на операционните системи. Подходите с отворен код позволяват на изследователи, разработчици и компании по целия свят да надграждат работата си едни върху други, ускорявайки напредъка и позволявайки независими одити на безопасността, които затворените системи не могат лесно да осигурят. Затвореният код означава, че кодът е частен — можете да използвате продукта, но не и да видите как работи, какъвто е случаят с GPT моделите на OpenAI — разграничение, превърнало се в един от определящите дебати в индустрията за ИИ.

Паралелизация

Паралелизацията означава извършване на много неща едновременно, вместо едно след друго — например 10 служители да работят едновременно по различни части на проект, вместо един служител да прави всичко последователно. В ИИ паралелизацията е основополагаща както за обучението, така и за инференцията: съвременните графични процесори са специално проектирани да извършват хиляди изчисления паралелно, което е една от основните причини да се превърнат в хардуерната основа на индустрията. С усложняването на ИИ системите и увеличаването на размерите на моделите способността за паралелизиране на работата между множество чипове и машини се превърна в един от най-важните фактори за определяне на това колко бързо и рентабилно могат да бъдат създавани и внедрявани моделите. Изследванията на по-добри стратегии за паралелизация вече са самостоятелна област на изучаване.

RAMageddon

RAMageddon е забавният нов термин за една не особено забавна тенденция, която обхваща технологичната индустрия: все по-големия недостиг на оперативна памет, или RAM чипове, които захранват почти всички технологични продукти, използвани в ежедневието ни. С разрастването на индустрията за ИИ най-големите технологични компании и лаборатории за ИИ — всички борещи се да разполагат с най-мощния и ефективен ИИ — купуват толкова много RAM за своите центрове за данни, че за останалите от нас не остава достатъчно. А това ограничение на предлагането означава, че наличното става все по-скъпо.

Това включва индустрии като гейминга (където големи компании се наложи да повишат цените на конзолите, тъй като намирането на чипове памет за устройствата им става по-трудно), потребителската електроника (където недостигът на памет може да доведе до най-големия спад в доставките на смартфони от повече от десетилетие) и общите корпоративни изчисления (защото тези компании не могат да се снабдят с достатъчно RAM за собствените си центрове за данни). Очаква се ръстът на цените да спре едва след края на страховития недостиг, но за съжаление няма особени признаци, че това ще се случи скоро.  

Рекурентна дълбочина

Това е по-„техническото“ наименование на същия основен метод като непрозрачната рекурентност (прекарване на заявка през слоевете на модела многократно, вместо последователно разсъждение на език). Медиите използват двата термина почти взаимозаменяемо, поради което ги включваме тук, макар че „рекурентна дълбочина“ е инженерният термин, а „непрозрачна рекурентност“ е формулировката, която подчертава опасенията за безопасността.

(Вижте „Непрозрачна рекурентност“, верига на мисълта.)

Рекурсивно самоусъвършенстване

Подобно на AGI, рекурсивното самоусъвършенстване е праг, определящ колко интелигентен може да стане ИИ и доколко малко може да разчита на хората. При сценария RSI ИИ моделите започват да се усъвършенстват без човешка намеса, което води до огромно ускоряване на възможностите и автономността им. В някои версии това би било катастрофален момент, подобен на сингулярността — момент, в който ИИ моделите стават имунизирани срещу външна намеса. RSI обаче описва и базова способност — може ли ИИ модел да проектира своя наследник? — което значително улеснява инженерите в опитите им да я изградят. Редица скорошни стартъпи в областта на ИИ си поставиха за цел да създадат рекурсивно самоусъвършенстващи се модели, но повечето отхвърлят апокалиптичните последици, представяйки RSI просто като следващия хоризонт на изследванията.

Подсилващо обучение

Подсилващото обучение е начин за обучение на ИИ, при който системата се учи, като изпробва различни неща и получава награди за правилни отговори — подобно на обучаването на любимия ви домашен любимец с лакомства, с изключение на това, че „домашният любимец“ в този сценарий е невронна мрежа, а „лакомството“ е математически сигнал, показващ успех. За разлика от контролираното обучение, при което моделът се обучава върху фиксиран набор от етикетирани примери, подсилващото обучение позволява на модела да изследва средата си, да предприема действия и непрекъснато да актуализира поведението си въз основа на получената обратна връзка. Този подход се е доказал като особено мощен за обучение на ИИ да играе игри, да управлява роботи и, по-скоро, да усъвършенства способността за разсъждение на големите езикови модели. Техники като подсилващо обучение от човешка обратна връзка, или RLHF, вече са централни за начина, по който водещите лаборатории за ИИ донастройват моделите си, за да бъдат по-полезни, точни и безопасни.

Токен

Що се отнася до комуникацията между човек и машина, съществуват някои очевидни предизвикателства — хората общуват на човешки език, докато ИИ програмите изпълняват задачи чрез сложни алгоритмични процеси, информирани от данни. Токените преодоляват тази разлика: те са основните градивни елементи на комуникацията между човек и ИИ, като представляват отделни сегменти от данни, обработени или произведени от LLM. Те се създават чрез процес, наречен токенизация, който разделя необработения текст на малки единици, смилаеми за езиковия модел, подобно на начина, по който компилаторът превежда човешкия език в двоичен код, разбираем за компютъра. В корпоративна среда токените определят и разходите — повечето компании за ИИ таксуват използването на LLM на база брой токени, което означава, че колкото повече използва една компания, толкова повече плаща.

Пропускателна способност на токените

И така, токените са малките фрагменти текст — често части от думи, а не цели думи — на които езиковите модели за ИИ разделят езика, преди да го обработят; за целите на разбирането на натоварванията на ИИ те са приблизително аналогични на „думи“. Пропускателната способност се отнася до това колко може да бъде обработено за определен период от време, така че пропускателната способност на токените по същество измерва колко работа с ИИ може да поеме една система наведнъж. Високата пропускателна способност на токените е ключова цел за екипите, изграждащи инфраструктура за ИИ, тъй като определя колко потребители може да обслужва един модел едновременно и колко бързо всеки от тях получава отговор. Изследователят на ИИ Андрей Карпати е описвал тревогата, която изпитва, когато абонаментите му за ИИ бездействат — подобно на усещането му като студент, когато скъпият компютърен хардуер не е бил използван пълноценно — чувство, което показва защо максимизирането на пропускателната способност на токените се е превърнало почти в мания в тази област.

Обучение

Разработването на ИИ системи за машинно обучение включва процес, известен като обучение. Казано просто, това означава подаване на данни, така че моделът да може да се учи от закономерностите и да генерира полезни резултати. По същество това е процесът, при който системата реагира на характеристиките в данните, което ѝ позволява да адаптира резултатите си към търсена цел — независимо дали става дума за идентифициране на изображения на котки или за създаване на хайку при поискване.

Обучението може да бъде скъпо, защото изисква много входни данни, а необходимите обеми нарастват — поради което хибридни подходи, като фино дообучаване на ИИ, базиран на правила, с целеви данни, могат да помогнат за контролиране на разходите, без да се започва изцяло от нулата.

[Вижте: Инференция]

Трансферно обучение

Техника, при която вече обучен ИИ модел се използва като отправна точка за разработване на нов модел за различна, но обикновено свързана задача — което позволява придобитите в предишни цикли на обучение знания да бъдат приложени отново. 

Трансферното обучение може да доведе до икономии на ефективност чрез съкращаване на разработката на модела. То може да бъде полезно и когато данните за задачата, за която се разработва моделът, са донякъде ограничени. Важно е обаче да се отбележи, че този подход има ограничения. Моделите, които разчитат на трансферно обучение, за да придобият обобщени способности, вероятно ще се нуждаят от обучение с допълнителни данни, за да се представят добре в своята област на фокус

(Вижте: Фино дообучаване)

Загуба при валидиране

Загубата при валидиране е число, което показва колко добре се учи ИИ моделът по време на обучението — и по-ниската стойност е по-добра. Изследователите я следят внимателно като своеобразна справка в реално време, използвайки я, за да решат кога да спрат обучението, кога да коригират хиперпараметрите или дали да проучат потенциален проблем. Едно от ключовите състояния, за които тя помага да се сигнализира, е преобучаването — състояние, при което моделът запаметява данните си за обучение, вместо наистина да научава закономерности, които може да обобщава към нови ситуации. Представете си разликата между ученик, който действително разбира материала, и такъв, който просто е запомнил миналогодишния изпит — загубата при валидиране помага да се установи в кой от двата се превръща вашият модел.

Тегла

Теглата са основополагащи за обучението на ИИ, тъй като определят колко важност (или тежест) се придава на различните характеристики (или входни променливи) в данните, използвани за обучение на системата — като по този начин оформят резултата на ИИ модела. 

Казано по друг начин, теглата са числови параметри, които определят кое е най-съществено в даден набор от данни за конкретната задача на обучение. Те изпълняват функцията си, като прилагат умножение към входните данни. Обучението на модела обикновено започва със случайно зададени тегла, но с напредването на процеса теглата се коригират, докато моделът се стреми да достигне резултат, който по-точно съответства на целевия.

Например ИИ модел за прогнозиране на цените на жилищата, обучен с исторически данни за недвижими имоти в даден район, може да включва тегла за характеристики като броя на спалните и баните, това дали имотът е самостоятелна или полу-самостоятелна къща, дали има паркомясто, гараж и т.н. 

В крайна сметка теглата, които моделът приписва на всеки от тези входни параметри, отразяват доколко те влияят върху стойността на имота въз основа на дадения набор от данни.

Тази статия се актуализира редовно с нова информация.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от TechCrunch на

Прочетете оригинала в TechCrunch ↗

Текстът и изображенията са собственост на TechCrunch и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини