Неделя прошла под одну мысль: леса, которые мы построили вокруг агента, теперь мешают сильнее, чем помогают. swyx призвал удалять накопленные скиллы, а Мэтт Шумер пошёл дальше и советует перед Opus 5 стереть всё сразу — скиллы, MCP, CLAUDE.md — и перестать диктовать модели способ решения. С другой стороны зашёл Thariq из Anthropic: ручное ревью ловит 13,6% вредных действий, классификатор auto mode — 89%, поэтому режим включают всем по умолчанию. Ложку дёгтя добавил Виктор Тейлин, у которого наивный цикл «модель ищет баги, модель их чинит» развалил доказанно корректный алгоритм. Хэмел Хусейн тем временем объяснил, почему харнесс и подписка Codex сейчас перевешивают Claude у заметной части ленты.
⚡
Главные приёмы недели
Десять приёмов, которые видно в ленте несколько раз или которые можно повторить сегодня вечером. Каждый — с парой «было / стало» и проверкой, зашло или нет.
01
Удалить накопленные скиллы и MCP перед тем, как звать новую модель
Каждую неделю ставлю очередной скилл «который изменил мне жизнь», и все они висят в контексте сессии.
→
Стало
Раз в неделю выношу то, чем не пользовался, и начинаю с чистого набора.
Почему лучше: swyx пишет прямо: в лучшем случае скиллы просто съедают контекст, в худшем — цепляются друг за друга так, что заметить это можно только по трассам. Разбор, на который он ссылается, называется «We Deleted Two Skills That Tried to Help». В нём и автономии, и инженерной дисциплины стало больше, а релизы Forge — хуже. Мэтт Шумер советует то же самое как условие для Opus 5, и его пост репостнул Thariq из Claude Code.
⚡ Попробовать за вечер
Открыть ~/.claude/skills и удалить всё, что не запускалось последние две недели.
Вычистить из CLAUDE.md инструкции, которые повторяют поведение модели по умолчанию.
Прогнать одну рабочую задачу на чистом наборе, не возвращая ничего обратно.
Что измерить: размер стартового контекста и число шагов агента мимо задачи — до и после чистки.
Расписываю агенту план: какими шагами, в каких файлах и в каком порядке работать.
→
Стало
Даю точку старта и нужный результат, маршрут модель выбирает сама.
Почему лучше: @daniel_mac8 разворачивает мысль так: чем сильнее модель, тем быстрее наши подпорки превращаются из помощи в обузу. Его аналогия — вы в Нью-Йорке и хотите в Калифорнию: скажите, где вы и куда надо, но не заставляйте ехать поездом. Ту же идею инженер Anthropic Феликс Ризеберг проговорил в Latent Space ещё в марте 2026-го.
⚡ Попробовать за вечер
Взять свой типовой промпт и вырезать все предложения, которые начинаются с «сначала», «затем», «используй».
Оставить три вещи: текущее состояние кода, требуемый результат, способ проверки.
Прогнать обе версии промпта на одной задаче в разных сессиях.
Что измерить: сколько раз пришлось вмешаться в ход работы в каждой из двух сессий.
Агент спрашивает разрешение на каждую команду, и к двадцатому вопросу я жму «да» не читая.
→
Стало
Каждое действие смотрит классификатор auto mode: он включён по умолчанию и не стоит дополнительных денег.
Почему лучше: в контролируемом исследовании, куда наняли 1053 разработчиков, ручное ревью поймало 13,6% вредных действий, auto mode — 89%. На прогоне 72 задач с браузером и вызовом инструментов (по 10 попыток на задачу) доля успешных prompt injection у Sonnet 5, Fable 5 и Opus 5 в auto mode — 0,00%. Сам Thariq предложил назвать анонс «defeating the lethal trifecta».
⚡ Попробовать за вечер
Обновить Claude Code и убедиться, что auto mode активен, а запуск через bypassPermissions из привычки не идёт.
Прожить на нём один рабочий день на реальном проекте, ничего не переключая руками.
Что измерить: сколько раз агент остановился сам и сколько раз пришлось откатывать его правки.
из твита @trq212
На картинке: два столбца — человек ловит 13,6% вредных действий, auto mode 89%.
из твита @trq212
На картинке: доля успешных prompt injection по режимам разрешений; в auto mode столбцы нулевые.
Ставлю цикл «модель ищет баги → модель их правит» и радуюсь длинному списку находок.
→
Стало
Между поиском и правкой стоит падающий тест: нет теста — находка остаётся вопросом.
Почему лучше: Тейлин прогнал такой цикл (GPT 5.6 Pro ищет, Fable 5 чинит) на алгоритме, корректность которого доказана формально. Уже на первых итерациях правильный код стал неправильным, дальше патчи чинили последствия предыдущих патчей, пока алгоритм не развалился. Модель отвечает не на вопрос «есть ли здесь ошибка», а на вопрос «есть ли здесь что-то, похожее на ошибку». Рядом Хэмел Хусейн предлагает во многих ситуациях считать прирост строк отрицательной наградой — та же мысль с другой стороны.
⚡ Попробовать за вечер
Дописать в промпт ревью правило: находка без воспроизведения — вопрос в список, а не задача на правку.
Развести искателя и правщика по двум сессиям, между ними — go test с новым падающим тестом.
Что измерить: из 10 находок агента — сколько подтвердились падающим тестом.
Под каждую новую задачу ищу готовый скилл или расширение.
→
Стало
Сначала проверяю встроенное: /visualize уже лежит в Codex, /loop работает просто как отправленная строка, ⌘+⌘ отдаёт агенту экран.
Почему лучше: три отдельных наблюдения за неделю сложились в одно правило. Хэмел Хусейн нашёл /visualize среди встроенных скиллов Codex. Джейсон Лю заметил, что команды /loop в Codex нет, но если отправить эту строку, агент понимает, чего от него хотят. Ромен Юэ показал computer use по ⌘+⌘: из любого приложения, без возврата в терминал.
⚡ Попробовать за вечер
Набрать / в Codex и дочитать список встроенных скиллов до конца.
Отправить /loop на длинной задаче и посмотреть, как агент её разложит.
Нажать ⌘+⌘ поверх чужого приложения и попросить разобраться с тем, что на экране.
Что измерить: сколько сторонних скиллов после этого можно снести.
из твита @HamelHusain
На картинке: при наборе /visua в списке появляется скилл Visualize — «Turn ideas and data into interactive visuals», рядом Knowledge Update.
Безопасность смотрю глазами на ревью, когда остаётся время и внимание.
→
Стало
Codex Security Review читает пул-реквест с учётом контекста репозитория и пишет замечания прямо в PR.
Почему лучше: замечания приходят туда, где их читают, — в обсуждение пул-реквеста, а не в отдельный отчёт, который открывают раз в квартал. Режим пока research preview, автоматические ревью включаются по инструкции.
⚡ Попробовать за вечер
Включить автоматические ревью по инструкции из документации.
Запустить на одном живом репозитории, где PR приходят каждый день.
Что измерить: на следующих 10 пул-реквестах — доля замечаний, которые вы приняли в работу.
Набор скиллов и конфигов MCP переношу руками из одного клиента в другой.
→
Стало
Собираю один плагин в общем формате, и его читают все совместимые клиенты.
Почему лучше: Agent Plugins — открытый стандарт, сделанный вместе с AWS, Cursor, GitHub, VS Code и Vercel. Плагин упаковывает Agent Skills и умеет описывать конфигурацию MCP-серверов, поэтому смена клиента перестаёт быть переездом.
⚡ Попробовать за вечер
Взять самый частый свой скилл и оформить его как плагин по общему формату.
Подключить в двух разных клиентах и сверить, одинаково ли он себя ведёт.
Что измерить: сколько времени уходит на перенос набора в новый клиент — до и после.
Новую версию проверяю руками, по памяти и по ощущению «вроде работает».
→
Стало
Сценарии лежат в спек-файлах, браузерный агент прокликивает их и собирает доказательства, отдельная модель ставит оценку по весовым рубрикам.
Почему лучше: swyx выложил такой набор для конкурса Kill My SaaS, чтобы участники сами проверяли свои решения. В README видно устройство: браузерный агент выполняет сценарии, складывает скриншоты, наблюдения и транскрипт действий, а судья оценивает по рубрикам с весами. Рубрики описывают функциональность и то, что должен показывать заполненный экран, а не пиксельное сходство. Что кликами не проверить — письма, экспорт, эффекты между пользователями, — уходит в ручной чек-лист и возвращается в итоговый балл.
⚡ Попробовать за вечер
Описать три сценария своего сервиса в specs/*.yaml: шаги, ожидаемое состояние, вес.
Дать агенту прокликать их и сложить скриншоты и транскрипт действий в отдельную папку.
Второй моделью выставить оценку по рубрике, не показывая ей исходный код.
Что измерить: расхождение оценки судьи с вашим ручным вердиктом на двух релизах.
из твита @swyx
На картинке: репозиторий killmysaas-evals, папка specs/ и таблица «What gets evaluated»: каждой области соответствует свой yaml и профиль веса.
Сам раскладываю задачу на шаги и веду агента по списку, сообщение за сообщением.
→
Стало
Формулирую цель в режиме ultracode, а воркфлоу из подзадач агент строит сам.
Почему лучше: swyx называет ultracode одной из важнейших находок среди режимов кодинга и приводит пример: участник конкурса Kill My SaaS собрал приличную заявку тремя промптами в ultracode. Ручное ведение съедает ваше внимание там, где динамический воркфлоу справляется сам.
⚡ Попробовать за вечер
Взять задачу, которую обычно ведёте руками: аудит зависимостей, миграция пакета, чистка мёртвого кода.
Сформулировать цель одним промптом в режиме ultracode и не вмешиваться до первого результата.
Что измерить: сколько своих сообщений ушло на задачу и сколько времени она заняла — против обычного режима.
Обратную связь по инструменту приносят только люди, и то если дойдут до issue.
→
Стало
У агента есть команда, которой он сообщает о трении с инструментом, и он же читает ответ мейнтейнера.
Почему лучше: Автор Minima CLI попросил Opus развернуть приложение на SolidStart через альфу SmolForge, собрал список раздражителей и превратил его в механику papercuts. Формулировка из его документации — «как агент сообщает о трении с самой Minima и читает, что ответил мейнтейнер». Если агенты становятся пользователями наших инструментов, им нужен штатный способ сказать, где мешает.
⚡ Попробовать за вечер
Добавить в свой CLI подкоманду papercut: пишет строку в файл или заводит issue.
Прописать в AGENTS.md, когда её вызывать: непонятная ошибка, недостающий флаг, лишний шаг.
Что измерить: через неделю прочитать собранное и посчитать пункты, которые вы бы сами не заметили.
Каждая правка ИИ оставляет неиспользуемые поля, разнобой в именах и устаревшие комментарии. Мусор подтягивается в контекст, ответы становятся хуже — и ощущение «модель испортилась через месяц после релиза» на деле про репозиторий, а не про модель.
PrimeIntellect показал самоулучшающийся харнесс с программными вызовами инструментов, контекстом как переменной и обменом сообщениями между агентами. День практики — и вердикт от jjpcodes: подагенты как код работают из коробки, но память забита бессмысленными записями, а выигрыша поверх официальных харнессов в реальной работе не видно.
Наложение поверх файловой системы с неизменяемым журналом в S3: состояние можно форкнуть, продолжить на другой машине и откатить к любому прошлому моменту. Похоже на опору для параллельных агентов — каждому своя ветка файлов вместо копий рабочего дерева.
По видео с Black Hat Саймон Уиллисон собрал подробный таймлайн со стороны OpenAI. Материал для своей модели угроз: агенту всё чаще дают и ключи, и сеть одновременно.