В середине августа 2026 в русскоязычных лентах про ИИ разошёлся один список: Georgia Tech CS 8803 Large Language Models, весна 2026. Рядом в поиске стоят «курс по LLM», «с чего начать учить LLM 2026» и «Georgia Tech LLM». Страницу курса на 21 августа 2026 мы открыли заново: она живая, лектор Wei Xu, пары по понедельникам и средам. Это не учебник «как устроен трансформер» и не набор видео для новичка. Это семинар, где каждую встречу разбирают одну-две свежие статьи. Ниже не конспект университета. Ниже порядок, в котором этот список полезен, если вы уже пишете код с агентом и хотите понять, почему модели стали лучше думать, дешевле отвечать и жить внутри редактора.
Что такое курс Georgia Tech LLM CS 8803
CS 8803 в Georgia Tech это номер «специальной темы», не вечный бренд. В разные семестры под ним идут разные курсы. Версия Wei Xu называется CS 8803 LLM. Осенью 2024 тот же номер был ближе к выравниванию: PPO, DPO, LoRA, Llama 3. Весна 2026 смотрит иначе: предобучение и MoE в начале календаря, дальше reasoning, agent harness, длинный контекст, GRPO, self-play, test-time scaling, линейные трансформеры, диффузионные языковые модели, безопасность и интерпретируемость.
Официальная страница: CS 8803 LLM, Spring 2026. Политика прошлого набора прямо говорит: это discussion-based research class, не лекции. Если нужны лекции, берите CS 7650. Предполагают машинное обучение, глубокое обучение и NLP. Нагрузка тяжёлая, проект тянет на 60% оценки. Для вайб-кодера это важно в одном смысле: вы не «проходите курс». Вы берёте карту чтения, которую уже отфильтровали.
С чего начать учить LLM в 2026. Не с BPE
Календарь стартует с предобучения и токенизации, потому что так собирают модель с нуля. Вы модель с нуля не собираете. Вы уже платите за выход: агент в редакторе, thinking-режим, MoE-инференс, квота на токены. Если открыть силлабус сверху вниз, первые две недели уйдут на смеси данных и эмбеддинги. Это честная наука. Это плохой старт, если вопрос звучит «с чего начать учить LLM 2026», а вечером нужно понять, почему агент забыл репозиторий и сжёг weekly.
Практический порядок переворачивает календарь. Сначала то, что уже крутится у вас в Cursor или Claude Code. Потом то, за что вы платите на инференсе. Потом то, почему одни веса дешевле других. Только после этого RL, из-за которого reasoning-модели вообще появились. Предобучение, scaling laws и sparse autoencoders оставьте, когда карта уже держится. Каркас самого вайб-цикла мы разбирали отдельно: как собрать сайт с нуля через AI.
Неделя 1. Agent harness: память и инструменты
В силлабусе это 23 февраля: блок Agent Harness. Для человека, который уже гоняет агента по репозиторию, это правильная первая полка. Две работы с этой недели закрывают две разные боли.
Agent Workflow Memory (Zora Zhiruo Wang и коллеги, 2024) про то, почему агент каждый раз заново изобретает один и тот же маршрут. Авторы вынимают из прошлых траекторий повторяющиеся workflow и кладут их в память, чтобы следующий заход шёл по готовому сценарию, а не с нуля. На Mind2Web и WebArena это дало заметный рост успеха и меньше шагов. В вашем редакторе тот же принцип уже живёт как rules, skills, CLAUDE.md и «не ищи по всему монорепо». Разница в том, что AWM учит агента самого собирать такие рутины, а не только читать ваш файл.
OpenHands Software Agent SDK (Xingyao Wang, Graham Neubig и команда All Hands, 2025) это уже не идея памяти, а каркас продакшен-агента: песочница, инструменты, маршрутизация моделей, локальный прототип и удалённый запуск. Если Cursor и Claude Code для вас чёрный ящик, эта статья показывает, из каких кусков ящик собран. Читайте её как схему, не как приглашение переписать свой стек за выходные. Соседний слой хранения кода: Cursor Origin и GitHub.
Практический выход недели: выпишите рутины, которые агент у вас повторяет, и где у него нет памяти между сессиями. AWM показывает, что длинный чат это не память. SDK показывает, что агент это цикл инструментов плюс изоляция, а не умный чат с доступом к диску.
Неделя 2. Test-time scaling: почему «подумай дольше» жрёт квоту
В календаре это 30 марта. Вам это нужно раньше. Запрос «курс по LLM» в 2026 почти всегда маскирует другую боль: модель думает минуту, токены тают, ответ лучше на десять процентов или никак. Блок Test-Time Scaling как раз про обмен «счёт на инференсе вместо ещё одной предобученной гигантской модели».
Базовая работа: Scaling LLM Test-Time Compute Optimally (Charlie Snell и коллеги, 2024). Короткий вывод, без формулы: больше compute на ответ помогает не всегда и не одинаково. На лёгком промпте выгоднее один короткий проход. На среднем часто выгоднее искать и проверять. На совсем трудном даже большой бюджет на инференсе не спасает, если базовая модель почти не умеет задачу. В FLOPs-сравнении меньшая модель с умным бюджетом на тесте иногда обходит модель в 14 раз крупнее. Рядом в том же блоке стоит Learning to Discover at Test Time: идея, что часть обучения можно перенести на момент запроса, а не только в предобучение.
Это прямо ложится на thinking-режим, reasoning_effort и «ещё один retry». Если вы жжёте weekly на каждую мелочь, вы платите test-time scaling там, где Snell советует короткий проход. Как это выглядит в квоте Claude Code: лимиты Claude Code и как экономить токены. Почему цена за миллион токенов врёт, когда выход раздувается размышлениями: сколько стоят токены Claude и GPT.
Практический выход недели: разделите задачи на три корзины. Мелочь без thinking. Среднее с одним проходом размышлений. Трудное с тестами как внешним verifier, не с бесконечным «подумай ещё». Бумага нужна, чтобы перестать включать максимальный reasoning по привычке.
Неделя 3. MoE, внимание и длинный контекст
В календаре MoE стоит 11 февраля, Attention 2 марта, Long-Context 25 февраля. Для практики это одна полка: почему одни модели дешевле на токене, почему окно «256k» не значит «весь монолит влезет», почему длинный чат вдруг тупеет.
Классика: Outrageously Large Neural Networks, sparsely-gated MoE (Noam Shazeer и коллеги, 2017). Дальше DeepSeek-V2 как живой пример дешёвого Mixture-of-Experts и Multi-head Latent Attention. В весеннем списке рядом DeepSeek-V3.2 и TransMLA. Идея одна: на инференсе активна часть экспертов, не все веса. Поэтому открытая MoE часто дешевле плотной модели того же «размера на бумаге». Если вы сравниваете локальную 27B и облачный MoE, смотрите активные параметры и KV-кэш, не строку «миллиарды» в карточке. Разбор локального плотного варианта: Qwen 3.8-27B на RTX 3090.
Длинный контекст в курсе закрывает Efficient Streaming Language Models with Attention Sinks (Guangxuan Xiao и коллеги, 2023). Первые токены окна держат внимание, как «раковина». Если их выкинуть при стриминге, качество падает даже при формально живом окне. Отсюда практический вывод, который агент вам сам не скажет: чистить начало сессии опаснее, чем кажется, а «просто увеличить контекст» не лечит плохую нарезку файлов.
Практический выход недели: в следующий раз, когда агент «не видит» файл, который вы уже клали, не докупайте окно. Проверьте, не вытеснил ли его лог, дифф и собственные размышления. Attention sinks объясняют, почему обрезанный хвост и обрезанная голова ведут себя по-разному.
Неделя 4. GRPO, self-play и код как среда
4 марта в расписании стоит блок Reinforcement Learning: GRPO, DAPO и Understanding R1-Zero-Like Training. Это слой, из-за которого в 2025-2026 reasoning-модели резко поехали вверх. GRPO это упрощённый родственник PPO: модель пишет несколько ответов на один промпт, сравнивает их внутри группы и подтягивает политику к тем, что прошли проверяемую награду. Награду часто даёт не человек, а юнит-тест, проверка числа, формат. DAPO чинит нестабильность этого рецепта. Критический разбор R1-Zero показывает, что у исходного GRPO есть сдвиг в сторону всё более длинных (и часто неверных) ответов. Dr. GRPO этот сдвиг подрезает.
Дальше в марте self-play. Absolute Zero убирает даже готовый набор задач: модель сама предлагает задания и сама их решает, а код-исполнитель служит средой с проверяемым сигналом. Рядом SPICE и работы про software-агентов, которые учатся в петле с репозиторием. CWM в списке 11 марта: открытые веса для исследований кодогенерации с «мировой моделью» кода, не просто next-token по GitHub.
DPO из блока 18 февраля читайте после GRPO, не до. Direct Preference Optimization это слой чат-модели, которой вы уже пользуетесь: предпочтения без отдельной reward-модели. GRPO это слой «пусть сама найдёт способ решить задачу, если есть проверка». Для вайб-кодера проверка это тесты, линтер, воспроизводимый баг. Без внешней проверки RL на вашем черновике это лотерея.
Практический выход недели: не пытайтесь «запустить GRPO дома». Поймите, какой сигнал вы уже даёте агенту. Если в цикле нет теста, вы просите модель выровняться по вашему настроению. Если тест есть, вы ближе к той среде, которую курс ставит в центр 2026 года.
Что из силлабуса можно подождать
Не всё в карте стоит первой очереди. Diffusion LM и линейные трансформеры это горизонт, не вечерний пайплайн. Sparse autoencoders нужны, если лезете в активации. Calibration полезен при ансамбле моделей. Scaling laws (Chinchilla, Scaling Laws for Precision) объясняют предобучение. К ним возвращайтесь, когда четыре недели выше уже легли.
Два исключения, которые не первая неделя, но и не «когда-нибудь».
- Emergent Misalignment (Jan Betley и коллеги, 2025). Узкий файнтюн на небезопасный код даёт широкое рассогласование на вопросах, которые к коду не относятся. Если вы дообучаете локальную модель «под студию» на своей смеси, это обязательное чтение. Не потому что ваш LoRA станет злодеем, а потому что узкий датасет двигает поведение шире, чем вы мерили.
- Artificial Hivemind из блока Mode Collapse. Открытые модели на открытых вопросах сходятся к похожим ответам. Если ваш контент и код вдруг звучат «как все», это не только промпт. Это свойство распределения, на котором всех учили.
Предобучение и эмбеддинги (Chameleon, MMTEB, NV-Embed) не выкидывайте. Просто не начинайте с них. Когда дойдёте, читайте как ответ на вопрос «из чего вообще слепили веса», не как домашку первой недели.
Как читать статью, если вы не аспирант
Первая пара курса так и называется: How to read a paper. Для вайб-кодера хватает короткого ритуала на 40 минут, не семинара.
- Заголовок, абстракт, рисунок 1. Если за 10 минут неясно, какую боль закрывают, откладывайте.
- Ограничения и негативные результаты. У Snell это «на слишком трудном промпте бюджет не помогает». У Dr. GRPO это «длиннее не значит умнее». У Emergent Misalignment это «эффект сильнее на одних моделях, чем на других».
- Один перевод в вашу сессию. Что меняется завтра: reasoning выключить на мелочи, рутину вынести в файл памяти, не резать первые токены чата, не файнтюнить на грязный код «просто чтобы умел».
Не реализуйте алгоритм из статьи, пока не можете назвать, какой сигнал награды у вас есть в проде. Семинар Georgia Tech как раз про чтение и спор, не про «повторить R1 на одной 3090».
Коротко
Курс по LLM Georgia Tech CS 8803 spring 2026 на 21 августа 2026 ещё на сайте Wei Xu. Это карта свежих работ, не учебник с нуля. Запрос «с чего начать учить LLM 2026» для вайб-кодера закрывается не календарём семестра. Сначала agent harness и память. Потом test-time scaling и квота. Потом MoE и внимание, чтобы понимать цену и окно. Потом GRPO и self-play, чтобы видеть, откуда взялся reasoning. Остальное из силлабуса подождёт. Читайте статью ради одного изменения в сессии, не ради галочки «прошёл Georgia Tech LLM».
