В днешно време водещите лаборатории за изкуствен интелект се надпреварват да създават самообучаващи се модели. Някои вярват, че това е най-сигурният път към суперинтелекта – според тази теория, докато ИИ се подобрява сам в главозамайващ цикъл, той в крайна сметка ще надмине човешкото разбиране (и може би дори контрол).

Всичко това е много хубаво, но аз трябва да издавам бюлетин. Запитах се дали рекурсивното самообучение не би могло да бъде полезно и за мен. Мога ли да използвам ИИ за обучение и постоянно подобряване на модел, който да автоматизира част от досадната работа по този бюлетин?

След около седмица експерименти отговорът изглежда е категорично и изненадващо „да“. Нещо повече, заниманието със самообучаващи се модели показва различна визия за това как може да се развие ИИ – такава, която не се върти около шепа компании, контролиращи цялата индустрия.

За да навляза в темата, експериментирах с обучението на малък езиков модел от нулата – под което имам предвид, че стоварих цялата трудна работа върху Claude.

Инсталирах AutoResearch, който помага на стандартен ИИ модел да изгради и подобри по-малък модел. AutoResearch е идея на Андрей Карпати, суперзвезда в изследванията на ИИ, който помогна за основаването на OpenAI, ръководеше работата по ИИ в Tesla и наскоро се присъедини към Anthropic.

Стартирах Claude и му дадох препоръчаната инструкция: „Здравей, разгледай program.md и нека започнем нов експеримент!“ Докато Claude вършеше трудната част, аз осигурих хардуера (Nvidia DGX, настолен „суперкомпютър“, проектиран за експерименти с ИИ), електричеството (работещо на пълни обороти няколко дни подред) и може би неразумната готовност да позволя на модела да прескочи всички обичайни проверки за разрешения, за да си върши работата.

Проверявах проекта AutoResearch на всеки няколко часа и се удивлявах как Claude коригира параметри и режими на обучение, гледаше как това променя резултатите на по-малкия модел и продължаваше да го усъвършенства.

Ето какво произведе една ранна версия на този по-малък езиков модел, когато го подканих да довърши фразата „В началото…“:

„В началото на началото на края на края на края края на края края края края края края края края началото края края края края…“

Не е особено блестящо. Но по-късните модели, подобрени автономно от Claude, станаха по-кохерентни и по-малко склонни към безумни, безкрайни повторения. Това едва ли е GPT-5, но показа обещаващ път към постоянно подобрение.

Вече използвам агент, базиран на Claude, който ми помага да намирам забележителни научни публикации, затова реших да видя дали е възможно да изградя нещо, което отива отвъд това.

Обърнах се към инструмент от стартираща компания, наречена Prime Intellect, която използва ИИ за обучение на персонализиран модел за конкретна задача. Събрах около 100 предишни публикации от рубриката „Другаде на границата на ИИ“ – кратките резюмета на изследвания, които следват основното есе в моя бюлетин. След това създадох среда за обучение в Prime Intellect и помолих Claude да ми помогне да изградя собствен модел, който той нарече Frontier_Paper_Curator, за намиране и обобщаване на интересни статии.

Claude откри още статии и генерира куп синтетични данни в помощ на обучението. След това се обърна към още един модел, за да оцени резултатите на Frontier_Paper_Curator, докато средата за обучение също подобряваше модела с обучение чрез подсилване (reinforcement learning).

Винсънт Уайсър, главен изпълнителен директор на Prime Intellect, която наскоро получи финансиране от 15 милиона долара, ми казва, че неговата компания има за цел да направи рекурсивното самообучение достъпно за всеки – не само за водещите лаборатории. Моделите, създадени от водещите лаборатории, може да са блестящи, но демократизирането на този вид обучение на ИИ може да произведе също толкова способни специализирани модели, казва той.

„Дайте на всяка компания достъп до водеща инфраструктура за обучение и колективната креативност на пазара ще отключи много повече, отколкото която и да е шепа лаборатории може да направи“, казва Уайсър. „Не искаме един централизиран, почти божествен интелект, искаме милиард интелекти, които да навлязат във всички ниши и да създават красиви неща.“

Prime Intellect не е единствената компания, която вижда бъдещето по този начин. Adaption, друг стартъп, предлага инструмент, наречен AutoScientist, който автоматизира обучението на ИИ модели. Главният изпълнителен директор Сара Хукър казва, че Adaption работи с няколко големи компании, които изразходват огромно количество токени и нямат собствени експерти по ИИ.

Когато Anthropic реши да блокира определени заявки към най-новия си модел Fable 5, това изложи на яве риска от прекомерно разчитане на един водещ модел. А някои ръководители, като Алекс Карп от Palantir, предупредиха, че използването на водещи външни лаборатории означава също така да предадете собствените си данни и контрола над технологията си.

Крайната цел на рекурсивното самообучение е изкуственият интелект да прилага иновативни идеи към даден модел и да достига до собствени прозрения. Инструментите, достъпни за останалите от нас, са по-ограничени, но все пак впечатляващи. След по-малко от ден работа с Prime Intellect успях да създам изненадващо добър модел за намиране и обобщаване на изследвания.