← Назад

Agent Briefing · выпуск 03

Скиллы и плагины недели

Неделя релиза Claude Fable 5.1 — и десяти репозиториев про то, сколько агенты съедают.

Период26 августа — 4 сентября
Прошли отбор73 репозитория
Скиллы ★30+22
Плагины ★30+12

Что вышло и что обсуждали

Релизы и обсуждения

Версии платформы за окно и сюжеты, вокруг которых шёл разговор. Каталог находок — в разделах ниже.

Claude Code 2.1.247 → 2.1.260 — четырнадцать версий

  • Флаг --restricted (2.1.248) — цельный урезанный профиль запуска одной настройкой: без инструментов, запускающих код, и без файлов настроек.
  • Хуки PreModelSwitch и PostModelSwitch (2.1.251); CLAUDE_CODE_SUBAGENT_MODEL теперь задаёт модель субагента по умолчанию, а не переопределяет всё.
  • --permission-prompts none (2.1.259) для необслуживаемых хостов и правило Containment Escape в auto mode (2.1.257).
  • Футпринт Workflow урезан с 5.7k до 1k токенов (2.1.248): справочник вынесен в бандловый скилл workflow-authoring.
Остальные изменения CLI

Три версии новее зафиксированной в состоянии 2.1.246 — 2.1.247, 2.1.248 и 2.1.250. Версии 2.1.249 в CHANGELOG.md нет; это не пропуск сбора, её там просто не опубликовали. Ниже — только то, что относится к агент-разработке.

Изоляция и безопасность. Главное в 2.1.248 — флаг --restricted (он же CLAUDE_CODE_RESTRICTED=1): убирает встроенные инструменты, которые запускают команды и код, и WebFetch (если он не назван явно в --tools), оставляет файловые инструменты внутри рабочей директории, отказывает в bypassPermissions и игнорирует пользовательские, проектные и локальные файлы настроек. Это первый в серии дайджестов случай, когда Anthropic даёт цельный «урезанный» профиль запуска одним флагом, а не набором отдельных настроек. Рядом — исправление, у которого читается сюжет: /ultrareview и локально засеянные облачные сессии больше не выгружают незакоммиченные правки файлов вида prod.env и *.tfvars, а также редакторские swap-, temp- и backup-копии файлов с секретами (key.pem.tmp, id_rsa.swo); теперь они остаются на машине.

Экономика контекста. В 2.1.248 добавлен experimental.cacheTtl ("5m" или "1h") прямо во фронтматтер агента — TTL промпт-кэша на конкретного агента, применяемый, когда общая настройка сабагентного TTL не задана. Там же починен промах кэша примерно раз в час в длинных сессиях: определения инструментов перерисовывались после обновления OAuth-токена, и вместе с кэшем терялся контекст расширенного мышления. И отдельно — футпринт самого инструмента Workflow урезан с 5.7k до 1k токенов: справочник по написанию скриптов вынесен в бандловый скилл workflow-authoring. Это ровно тот же ход, что год назад проделали с claude-api (200k → 25k), и он подтверждает линию: описание инструмента — не место для документации.

Мульти-агентность и сессии. Кросс-сессионные сообщения (SendMessage / ListAgents) между сессиями на одной машине дошли до Bedrock, Vertex и Foundry, а также до конфигураций с отключённой телеметрией — раньше канал был доступен не везде. SendMessage из сабагента в другую сессию теперь честно сообщает, что ответ придёт в разговор родительской сессии, а не сабагенту. В 2.1.247 починена неприятная штука: сабагенты умирали на первом же 404 по модели — теперь они используют цепочку фолбэков сессии, а ошибка родителю содержит тип, статус, request id и модель. Там же — защита от переполнения: хук или фоновый агент, напечатавший мегабайты вывода, больше не может «заклинить» сессию на «Prompt is too long».

Инструменты для работы с API. В 2.1.247 у скилла /claude-api появилась подкоманда cost-optimize — профилирует траты существующего проекта и проводит по рычагам стоимости (кэширование, гигиена токенов, batch, effort, выбор модели) по одному измеряемому изменению за раз. Сам скилл дополнен покрытием Admin API: участники организации, инвайты, воркспейсы, ключи, отчёты по рейт-лимитам, workload identity federation, CMEK.

Прочее по мелочи, но по делу. /loop в самопейсящем динамическом режиме и автономный режим без промпта стали доступны везде, включая Bedrock/Vertex/Foundry. Окно авто-компакта Sonnet 5 переведено на полный 1M контекст: авто-компакт теперь около 967K токенов вместо примерно 934K. Добавлен инструмент SendFeedback — Claude может составить черновик отчёта о проблеме, который человек отправляет через /feedback. Плюс закалка marketplace плагинов: имена с управляющими и невидимыми символами отклоняются.

Claude Code CLI 2.1.251 → 2.1.260

Версии новее зафиксированной 2.1.250: 2.1.251, 2.1.252, 2.1.257, 2.1.258, 2.1.259, 2.1.260. Версии 253–256 в публичном changelog отсутствуют — это не пропуск сбора.

Модели и субагенты

  • Новые хуки PreModelSwitch и PostModelSwitch (2.1.251) — можно блокировать, подтверждать или аннотировать смену модели. Хуки SessionStart при возобновлении теперь получают степень «протухания» сессии и оценку стоимости повторного кеширования.
  • Смена семантики CLAUDE_CODE_SUBAGENT_MODEL (2.1.251): переменная теперь задаёт модель субагента по умолчанию, а не переопределяет всё; model: в определении агента и явная модель при спавне имеют приоритет. Для жёсткого переопределения добавлен CLAUDE_CODE_SUBAGENT_MODEL_FORCE (2.1.257).
  • Живая трансляция вызовов инструментов переднего субагента в Remote Control (2.1.251); фоновые, которые по умолчанию, по-прежнему показывают только статус.
  • Починены агентные команды: финальный ответ тиммейта доходит до лида, фоновые субагенты снова могут отвечать безымянному сиблингу или родителю (2.1.251); субагент, возобновивший другого агента через SendMessage, наконец просыпается по его завершении (2.1.260).
  • Снят часовой лимит на фоновые команды, запущенные субагентами (2.1.260).

Разрешения и изоляция — самая плотная линия окна

  • --permission-prompts none (2.1.259) для необслуживаемых headless-хостов: всё, что запросило бы подтверждение, автоматически отклоняется, при этом активный режим разрешений продолжает решать.
  • managedMcpServers (2.1.259) — организация может раздать HTTP/SSE MCP-серверы всем пользователям.
  • Правило Containment Escape в auto mode (2.1.257): обращения к метаданным облачных кредов, обход egress-ограничений и дотягивание до чужого тенанта больше не одобряются автоматически.
  • Заткнуты подмена симлинка внутри рабочей директории после проверки прав (2.1.251), выход плагиновых команд за пределы каталога плагина (2.1.251), чтение scriptPath инструментом Workflow до проверки прав (2.1.251) и несколько способов проскочить проверку Bash через особенности zsh (2.1.257, 2.1.260).
  • В 2.1.260 откатили изменение 2.1.259, распространявшее Read()-deny-правила на аргументы Bash: оно запрещало npm run build под правилом Read(./**/build/**).

Наблюдаемость и работа

  • Панель диффа рядом с диалогом в полноэкранном режиме (/diff) и вероятная причина промаха промпт-кеша в /cost и статус-строке (2.1.260).
  • Строка промпт-кеша в /cost — доля попаданий, промахи, перекешированные токены (2.1.251).
  • Текстовая форма /advisor для десктопа, Remote Control и headless-сессий (2.1.260).
  • Workflow: agent({schema}) заранее отклоняет заведомо невыполнимую JSON-схему, а ошибки исчерпания ретраев включают последнюю ошибку валидации (2.1.260).
  • Автокомпакт для моделей с 1M контекста и правки изоляции worktree — фоновые сессии и субагенты снова могут править файлы в созданном ими worktree (2.1.251).

Модели — Claude Fable 5.1 и Mythos 5.1, 01.09

Анонс Anthropic — 1407 очков на HN, крупнейший официальный сюжет за историю серии. claude-fable-5-1 становится моделью Fable-уровня по умолчанию: $10/$50 за Mtok, чтение кеша $0.25/Mtok, снижение стоимости примерно на 25% для типовых нагрузок и до 45% на выраженно агентных. Контекст 1M назван не в анонсе, а в CHANGELOG 2.1.257. Заявка именно про долгую автономию: пример 38-часового непрерывного прогона над ML-задачей, в котором модель сама разобрала прежние результаты и запустила параллельные эксперименты. Mythos 5.1 — та же модель с ослабленными ограничителями для проверенных специалистов по кибербезопасности и биологии.

Практическое следствие для агент-разработки — в изменениях API: принудительный tool_choice any/tool теперь возвращает 400, а блоки размышления сохраняются только для той модели и того диалога, которые их произвели. Это ломает наивную реализацию «переписать историю и продолжить».

Сюжеты недели

Разборы — в «Исследованиях и наблюдениях» в конце выпуска.

От разработчиков платформы

Официальные скиллы и плагины

Изменения официальных каталогов за окно: что добавилось в anthropics/skills и в маркетплейс плагинов. Релизы моделей и CLI — в начале выпуска.

anthropics/skills — две правки: frontend-design и claude-api

frontend-design (03.09, 36+/20− в одном SKILL.md) — самый интересный официальный текст окна, потому что это редкий случай, когда Anthropic публично перечисляет признаки собственного машинного почерка. Скилл и раньше просил не выдавать шаблонный дизайн; новая редакция заменяет общие призывы конкретным списком «умолчаний»:

  • Тёплый кремовый фон около #F4F1EA с контрастным шрифтом с засечками и терракотовым акцентом — причём теперь прямо сказано, что акцент около #D97757 — это собственный фирменный цвет Anthropic, и в чужом брифе он читается как улика.
  • «SaaS-карточный набор»: контент, нарезанный на одинаковые скруглённые карточки, один радиус скругления на всё независимо от иерархии, одна и та же мягкая серая тень rgba(0,0,0,.1) под каждой, градиентные заливки как украшение.
  • «Шаблонная обвязка», появляющаяся независимо от темы: разрежённая ALL-CAPS-надстрочная подпись над каждым заголовком, мета-строки через средние точки (A · B · C), конструкции вида СЛОВО — фрагмент со шпационированным тире, притемнённый почти-чёрный (#0B0B0B, #111) вместо чёрного, моноширинный шрифт для мелких подписей к данным, стрелка →, приписанная к тексту ссылок и кнопок.
  • Типографика: не выделять одно слово в заголовке курсивом, жирным или цветом; не набирать подписи капсом; не добавлять лишних типографских лейблов над контентом. Строка короче 80 знаков по умолчанию, масштаб по «Элементам типографского стиля» Брингхерста.
  • Анимация: одно оркестрованное движение вместо россыпи эффектов; «выезд с затуханием» на каждой секции и переход при наведении на каждой карточке названы генеративным умолчанием.

Полезно это не только дизайнерам: текст показывает рабочий приём — вместо «сделай небанально» дать модели явный список её собственных умолчаний с запретом тратить на них свободные оси брифа.

claude-api (01.09, правки в 30+ файлах на семи языках) — синхронизация с релизом. По существу агент-разработки:

  • Новый раздел миграции с Fable 5 на Fable 5.1 в shared/model-migration.md, включая три ломающих изменения.
  • Новые возможности API: усилие (effort) на уровне сообщения, системные сообщения посреди диалога с областью действия на ход (clear_at), прогресс через thinking.display: "updates", управление block_binding, ставка чтения кеша 0.025× и паттерн keep-alive через max_tokens: 0.
  • Managed Agents: самохостящиеся песочницы могут подключать memory stores через SDK-воркер; фильтры доменов для web_search/web_fetch; типизированные объединения конфигов по инструментам; просмотрщик сессий в Консоли.
  • Новая подкоманда cost-optimize и справочник Admin API. Sonnet 5 закрепился на $2/$10. Files API и Skills API вышли из беты.
  • Вся проза переведена в чистый ASCII, чтобы будущие диффы оставались чистыми, — мелочь, но показательная для тех, кто ведёт большие скиллы в git.

claude-plugins-official — два новых плагина

  • activecampaign (влит 28.08 06:33 UTC) — единственный новый плагин окна. PR минимальный: один файл, .claude-plugin/marketplace.json, +15 строк. То есть в официальный marketplace добавлена только запись каталога, сам плагин живёт во внешнем репозитории вендора — та же схема раздачи, что у Unity и NetSuite в прошлом окне.
  • Партнёрские бампы Carta — три PR подряд 27.08 вечером (#5609, #5610, #5611): carta-cap-table, carta-crm, carta-investors. Обновление версий, содержательных изменений в раскладке marketplace нет.

Во второй половине окна добавился scandit-sdk (28.08, промоушен community → official), обновился Claude Security до v0.11.0 и поправлены метаданные newrelic и nvidia-skills. Фоном — бампы версий партнёрских плагинов: carta, salesforce, jfrog, atlassian, databricks, mongodb, figma и ещё несколько десятков.

Стоит отметить связку: правка frontend-design в anthropics/skills 03.09 и правка /frontend-design в маркетплейсе 01.09 — одна официальная линия про борьбу с шаблонным машинным дизайном, идущая сразу по двум репозиториям.

Anthropic за неделю — Commerce Agents Blueprint, 02.09

Anthropic выложила готовый «чертёж» коммерческих агентов: рабочие реализации покупательского и торгового агента на GitHub, живые демо и инженерный разбор. Само по себе это продуктовый анонс для ритейла, но два момента переносятся за пределы коммерции: в реализациях показаны продакшен-паттерны — ограничители (guardrails), лимит итераций по инструментам и кеширование промптов, — а кастомизация агента под конкретный каталог и требования бренда предлагается через плагин Claude Code. Это не релиз возможностей Skills или Plugins, а витрина решения; в каталог не идёт, но как официальный агентный материал окна упоминания заслуживает.

Новые практики

Скиллы 10 из 22 · ★30+

★357

s0xDk/refactoring-ui-skillдизайн

Топ окна и, пожалуй, самый чистый пример жанра «книга → скилл», который в этой серии уже встречался (Leutenegger/book-to-skill ★1185 в дайджесте 18.08). Здесь не генератор, а результат: конкретные механические правила из книги Refactoring UI Адама Уотана и Стива Шогера — ограниченные шкалы отступов, кеглей, цвета, теней и радиусов вместо произвольных значений; иерархия через насыщенность и цвет, а не через наращивание размера шрифта; глубина через имитацию источника света. Автор заявляет, что каждое правило и каждое CSS-значение сверялось с книгой постранично: «это не пересказ — это решения книги, принятые один раз и готовые к применению».

Структура типовая и аккуратная: SKILL.md как процедура плюс три файла references/ (построение палитры от нуля в HSL, таблица «симптом → починка» для уже существующего интерфейса, техники глубины и работы с изображениями) и assets/tokens.css с проверенным на контраст стартовым набором токенов. Самой книги внутри нет — только выводы. Отдельно стоит отметить таблицу «симптом → починка»: она превращает расплывчатую жалобу («выглядит дёшево») в конкретную механическую правку, то есть решает ровно ту задачу, на которой агент обычно буксует. 28 КБ, лицензия нестандартная (NOASSERTION).

★276

op7418/guizang-yingzao-skill медиа вне темы агент-разработки

Скилл для Claude Code и Codex, превращающий фотографии китайской традиционной архитектуры и «мест с культурой» в постеры редакционного уровня через GPT Image. Верхняя строка каталога по звёздам и при этом полностью прикладная вещь: к тому, как строить агентов, отношения не имеет. Полезен как индикатор — такие «скиллы-художники» стабильно собирают верхний тир, потому что результат показывается картинкой, а не описанием. Репозиторий содержательный (64 МБ, Python, директория yingzao), но без лицензии.

★275

leopard627/fire-your-seo-agencyмаркетинг

Корейский скилл с прямолинейным тезисом: «платите агентству $400–2500 в месяц за оптимизацию под AI-поиск? Увольте их». Аргумент устроен интереснее лозунга: то, что агентства продают как ретейнер, — это публичные стандарты и повторяемые чек-листы, а повторяемый чек-лист по определению есть скилл. Автор разделяет «поисковую оптимизацию» на пять непересекающихся дорожек, и каждой ставит свой вопрос: SEO (краулеры Google/Bing — могут ли они вообще прочитать и проиндексировать), AEO (блоки AI-ответов — цитируют ли), GEO (ChatGPT/Perplexity/Claude при обходе сети — я ли первоисточник), LLMO (знает ли модель бренд из собственных весов и знает ли верно) и NEO — корейский Naver с его AI Briefing. Последняя дорожка и есть то, чего нет в глобальных руководствах, а она держит половину корейского рынка. Заявленные цифры даны на своём же проекте: 1.54 млн показов за 30 дней и 7.4 тыс. кликов при нулевых тратах на рекламу — цифры авторские, не проверялись. Ставится как плагин через /plugin marketplace add. MIT, 1.2 МБ, README на двух языках.

★208

KKKKhazix/sun-style-writingвне темы

Китайский скилл, разбирающий десять приёмов повествования из книги «我的女友景甜» и обучающий модель писать действием, числами, предметами и молчанием вместо обобщённых эмоциональных формул. Демонстрация в README сделана честно и показательно: обычная модель на просьбу описать увольнение выдаёт «百感交集 / 青春 / 落幕» — три абстракции подряд; целевой стиль вместо этого пишет «на ресепшене перерезали мой бейдж. Ножницы застряли дважды. Она взяла другие». Ни одного слова о слезах. К агент-разработке отношения не имеет; в каталоге только потому, что ранжирование строго по звёздам. Полезен как образец узкой стилевой инструкции, где вся ценность в отрицательных примерах, а не в правилах. MIT, 7 МБ (в основном иллюстрации).

★161

Vuk97/forward-implementation-first процесс

Лучшая находка окна по существу агент-разработки. Скилл описывает конкретный режим отказа длинных агентных конвейеров: пайплайн обрастает служебной бухгалтерией — хешами содержимого, лок-файлами, «расписками» о том, что стадия отработала, маркерами сертификации, — и модель начинает принимать эту метаданную за продукт. Автор разбирает цепочку по шагам: агент видит несовпадение хеша после правки продюсера, трактует его как отказ корректности, инвалидирует стадии с 12-й по 40-ю «на всякий случай», отказывается запускать 41-ю вручную, потому что «пайплайн не может выдать расписку за ручной запуск», и следующие несколько часов регенерирует маркеры для стадий, вывод которых не менялся. Каждый шаг по отдельности защитим, вместе они стоят суток. Лечение — одна классификация перед каждым действием (семантическая реализация / сфокусированная валидация / администрирование) и короткий список запретов. Около 150 строк Markdown, без привязки к модели, инструменту и домену. MIT.

★156

saurabhkumar8112/cyclomatic-complexity-skillкод-качество

Самая точная в окне формулировка проблемы AI-кода: «он работает, но ветвится как джунгли». Скилл меряет цикломатическую сложность по функциям (radon, eslint, gocyclo, lizard или ручной подсчёт), уважает пороги, уже настроенные в линтере проекта, и рефакторит худшие горячие точки известным набором приёмов — guard clauses, extract function, таблицы соответствий, именованные предикаты.

Ценны два предохранителя. Первый: явный отказ «играть с метрикой» — сложность переносится в функции с осмысленными именами, а не в хитрые однострочники, которые формально снижают число ветвлений. Второй: каждый рефакторинг заканчивается таблицей «до / после» по функциям плюс подтверждением, что существующие тесты прошли, — то есть скилл обязан предъявить измеримый результат, а не отчитаться словами. Раздаётся тремя способами сразу: /plugin marketplace add для Claude Code, .skill-файл из релизов для claude.ai, Skills API для Claude API. Apache-2.0, 7 КБ — весь скилл помещается в один SKILL.md.

★138

aleksandr-alhoff/seo-landing веб

Скилл, дающий кодовому агенту компетенции старшего технического SEO-инженера: сборка лендингов с целевым 100/100 в Google PageSpeed и оптимизацией Core Web Vitals. Отличается от массы SEO-скиллов тем, что в репозитории лежат benchmark/, tests/ и references/ — то есть заявленное можно проверить, а не только прочитать. Есть README на русском. MIT.

★132

GENEXIS-AI/gpt-image-skillмедиа (создан до отсечки окна)

Генерация и правка изображений из Codex, Claude Code или Google Antigravity через подписку ChatGPT пользователя, а не через Images API. Прямые промпты идут как есть; когда пользователь делегирует несколько разных вариантов дизайна, агент сам разворачивает под каждую концепцию отдельный промпт. Реальные референсные файлы передаются в генерацию, PNG с прозрачностью проверяются на наличие альфа-канала, результат остаётся в активном проекте, готовые задания идут с ограниченным параллелизмом.

Отдельно стоит отметить дисциплину README в части границ: репозиторий явно проговаривает, что не вызывает OpenAI Images API и не создаёт отдельно тарифицируемых запросов, но встроенная генерация всё равно расходует включённый лимит ChatGPT/Codex, недоступна на Free-плане и тратит лимит в 3–5 раз быстрее обычных ходов — «этот скилл эту границу не обходит». Для категории «мост к чужой подписке» такая честность нетипична. Есть CI-валидация скилла. Создан 26.08 в 08:52 UTC, за 18 минут до отсечки прошлого прогона —

★131

camilleroux/genart-skill медиа

Скилл генеративного искусства для Claude Code с упором на детерминированность: всё сеется хешем, результат воспроизводим и готов к ончейн-публикации. Аккуратно собранный репозиторий — .claude-plugin, AGENTS.md, CLAUDE.md, CHANGELOG.md, tests/. Для агент-разработки интересен именно требованием детерминированности: это редкий пример скилла, который заранее решает проблему воспроизводимости вывода модели.

★105

ashutoshsinghpr7/wikiskill память

Реализация статьи «WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution» (arXiv:2608.27454, подана 27.08 — на день раньше окна; авторы Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu). Идея: опыт агента обычно умирает вместе с сессией, поэтому рядом со скиллами держится постоянная вики, и крутится замкнутый цикл — агент проходит обучающие задачи, «сопровождающий вики» агент дистиллирует трассы в страницы паттернов с корневыми причинами и починками, «предлагающий скиллы» агент читает вики и трассы и предлагает одно изменение скилла, после чего изменение валидируется на отложенных задачах и принимается только если строго лучше лучшего прежнего результата, иначе откатывается. Ключевая асимметрия: скиллы откатываются, вики — никогда, так что знание копится даже из неудачных попыток. Референсный бэкенд — Hermes Agent, но Claude Code, Codex и GitHub Copilot CLI поставляются в коробке. Есть пакет на PyPI, CI, сайт документации. MIT.

Показать остальные 12 позиций и 23 строки ★ 10–30
★102

ara-mkr/Wonder-Pill процесс

Скилл, который принципиально отказывается давать ответ. На запрос он выдаёт интерактивную ментальную карту перевёрнутых допущений — с ветками, тупиками и точками, где мышление сошлось, — которую можно таскать мышью. README прямо предупреждает: «Wonder Pill не генерирует хорошие идеи. Он и не должен», и объясняет, что половина вывода будет бессмыслицей по замыслу, а не по дефекту. Ценность для агент-разработки — в честном подходе к калибровке ожиданий: скилл заранее описывает, как выглядит его нормальная работа, чтобы её не приняли за поломку. MIT.

★98

Tyche-MKR/scientific-agent-skills наука

Библиотека из 165 валидированных скиллов и 100+ научных баз данных по биологии, химии, медицине и разработке лекарств, совместимая с Claude Code, Cursor, Codex, Pi, Antigravity и открытым стандартом Agent Skills. Заявка «используется 190 000+ учёных» — маркетинг из README, не проверялась. Репозиторий при этом крупный и обжитой (248 МБ, scan_skills.py, scan_pr_skills.py, тесты, plugin.json), то есть за заявкой стоит реальная машинерия. Для агент-разработки интересен как образец того, как сопровождать библиотеку скиллов в сотню единиц: автоматические сканеры скиллов и скиллов из PR.

★98

v2space-labs/shader-for-interfaces дизайн организация

Скилл для проектирования, сборки, отладки и визуальной проверки GPU-эффектов внутри продуктовых интерфейсов: выбор рендерера (CSS / SVG / Canvas 2D / Three.js-WebGL / WebGPU-WGSL), работа с GLSL и WGSL, частицы, интеграция в UI, производительность, доступность, проверка в браузере. Ставится через npx skills@latest add. Сильная сторона по методу — скилл описывает не только как построить эффект, но и как убедиться, что он получился: пиксельные проверки через Node, поддержка prefers-reduced-motion, верификация на десктопе и мобильном. Версия 0.1.0 от 30.08, MIT.

★87

Ayueh0102/Ronnier-skillзнания (создан до отсечки окна)

Полный конспект по цветоведению и колориметрии на традиционном китайском, упакованный как скилл Claude Code и Codex: CIE-колориметрия, CIELAB, CIEDE2000, CIECAM02, хроматическая адаптация, цветопередача. Ставится и отвечает на вопросы вроде «чем яркость отличается от светлоты» или «почему в CIEDE2000 есть поворотный член», причём заявленный порядок ответа — сначала объяснить, какую задачу эта штука решает, и только потом давать определение и формулу. Приём, который стоит отметить отдельно: скилл работает и без агента — всё содержимое references/ — чистый Markdown, читаемый как обычный конспект, с точкой входа references/README_索引.md. Это редкий в выборке случай, когда автор явно проектирует артефакт под два режима чтения сразу. Создан 26.08 в 07:18 UTC, за два часа до отсечки прошлого прогона.

★75

heyman333/agent-notion-template-docs документация

Скилл, заставляющий агента писать документы в структуре и визуальном стиле Notion — то есть фиксирующий шаблон документа, чтобы вывод не расползался от запуска к запуску. В репозитории есть hooks/, sync/ и .claude-plugin, так что это не только текст скилла, но и механика синхронизации. README на английском и корейском. MIT.

★49

Junhan2/oh-my-fable промптинг

Руководство по промптингу Claude Fable 5.1, оформленное как набор скиллов Claude Code, на корейском, английском и китайском. Появился 02.09 — через день после релиза модели, что само по себе показатель скорости реакции экосистемы. Автор утверждает, что качество вывода растёт и на Opus 5 с Sonnet 5. Есть hooks/ и .claude-plugin. MIT.

★43

boringmarketer/meta-ads-skill маркетинг вне темы агент-разработки

Скилл, обучающий кодового агента вести рекламу в Meta: настройка API, программные кампании, управление браузером и отслеживание конверсий. Прикладной, к устройству агентов отношения не имеет, но структурно опрятен — SKILL.md, reference/, scripts/. MIT.

★38

emlai/defi-native-skill финансы вне темы агент-разработки

Скилл, дающий агенту понимание ончейн-рынков капитала: волты, кураторы, декомпозиция доходности, классы оракулов, RWA, стейблкоины. Методически любопытная деталь на общем фоне — заявленная «дисциплина живых данных»: каждое число датировано, каждая доходность разложена, доступ всегда только на чтение. В репозитории есть evals/, llms.txt и manifest.json. MIT.

★37

Endokelp/Only-Skill-You-Needпроцесс

Мета-скилл, решающий проблему, которую сама экосистема и создала. Постановка прямая: «у агентов уже сотни скиллов. Они всё равно берут не тот, пропускают нужный или ставят второй скилл на задачу, которая уже занята». Существующий find-skills ищет по реестру, когда его спрашивают; здесь предлагается слой выше — пакетный менеджер: определить репозиторий, дозаполнить пустые сценарии использования из живой экосистемы, вести реестр установленного и заставить агента прочитать победителя перед тем, как писать код. Правило раскладки — «один слот на задачу, никогда не заменять лучший скилл худшим автоматически». Ставится как первый скилл вообще, через npx skills add Endokelp/Only-Skill-You-Need -g -y, и дальше должен срабатывать раньше остальных. Работает с Claude Code, Cursor, Codex, Copilot — со всем, что читает SKILL.md. Живая проверка по реестру skills.sh заявлена бейджем. Идея не бесспорная (агент, выбирающий агентам инструменты, — ещё один слой, которому надо доверять), но проблема названа верно и раньше других. Python 3.10+ на одной стандартной библиотеке, MIT.

★37

naderelewa/Product-to-Prod процесс

Набор продуктовых скиллов и плагин для Claude Code, Cowork и Codex: PRD с тегированными свидетельствами, спеки, приоритизация по RICE, скоринг бэклога и роадмапа, GTM-планы, верификация релиза, бенчмарк-паки. Заявленный принцип — «каждое утверждение либо со ссылкой на источник, либо явно помечено как неподтверждённое», что делает его любопытным именно как приём борьбы с уверенным враньём модели в продуктовых документах. Есть config.schema.json, packs/, tests/. MIT.

★36

glukicov/slideops документация

Пара скиллов, обращающихся с презентацией как со сборочным артефактом: колода генерируется из репозитория, записывает, из чего она построена, за миллисекунды проверяет, разошлась ли она с кодом, и пересобирает только уехавшие слайды. Формулировка автора — «писать документацию больше не узкое место; узкое место — держать её правдивой». Демо-колода из 17 слайдов собрана самим SlideOps. Есть статья автора на Medium, CI, pre-commit, ноль зависимостей. MIT.

★31

axelfreeman/marketing-mindset маркетинг вне темы агент-разработки

«Маркетинговая ОС для агентов»: сначала мышление маркетолога, тактики — на выходе. Из технически любопытного — рядом с SKILL.md лежит SKILL.lite.md, то есть автор явно разделил полную и облегчённую версии под разный бюджет контекста. Есть llms.txt и .cursorrules. MIT.

★10–30 — одной строкой

  • ★27kobingogo/motion-sticker-packмедиа — Agent Skill для Codex: из изображения персонажа собирается зацикленный стикерпак с настоящей прозрачностью (WebP/GIF/PNG + ZIP); прозрачность проверяется попиксельно, а не по превью с шахматкой.
  • ★26 sva-admin/sv-academy-prom-design дизайн готовый «вкус» оформления для Claude Code, Cowork и Cursor.
  • ★23 Socialpranker/zodchiy код-качество архитектурный аудит, где находка допускается в отчёт только после того, как её цена измерена по git-истории; доктрина плюс CLI без зависимостей.
  • ★23 fabricioctelles/jump-skills мульти-агентность мета-скиллы-маршрутизаторы, подбирающие и подгружающие нужный скилл из библиотеки вместо ручного поиска.
  • ★21shamashel/testing-on-the-toiletкод-качество — выжимка из выпусков Google Testing on the Toilet за 2007–2026: что хороший тест утверждает, от чего отказываться, как выбирать дублёры и уровни; 8 КБ, ставится через npx skills add.
  • ★21 gquthier/company-os процесс шаблон «операционной системы компании»: шина, два реестра, ступенчатая автономия, самозалечивающиеся циклы.
  • ★20 fajrisilmi12-cyber/hermes-socmed-function интеграция скиллы Hermes Agent для генерации картинок и постинга в соцсети.
  • ★19ToolMonsters/hand-raisersинтеграция — находит тех, кто на этой неделе публично попросил то, что вы продаёте, квалифицирует запрос, проверяет, насколько тред уже забит ответами, и пишет черновик; жёсткие ворота по свежести (старше 7 дней — в отсев) и обязательный Bright Data MCP — без него не работает вовсе.
  • ★19 maxritter/open-claude-design дизайн дизайн из реальных компонентов, токенов и состояний проекта, с обратной синхронизацией правок.
  • ★18atukunare/wiki-knowledge-agentпамять — «ваш AI забывает, а вики — нет»: вставленные в чат ссылки и текст проверяются (HTTP-статус, редиректы), переводятся, сжимаются в заметку и складываются в вики, а срочное попадает в локальную очередь напоминаний; нулевые зависимости сверх curl и стандартной библиотеки Python.
  • ★17Miint-Sunny/nai5-promptingмедиа — метод написания промптов для NovelAI Diffusion V5, собранный не из опыта, а из 2226 замеренных изображений и 962 реальных промптов, с контрольными выпусками на фиксированном seed; сам метод-файл прогонялся через разные модели и правился там, где нарушения концентрировались.
  • ★17 Daqi029/saas-onboarding-diagnosis продукт диагностика онбординга, активации и time-to-value в SaaS.
  • ★17 shaokeyibb/flow-brief документация превращает систему или ещё не построенную фичу в однофайловый HTML-бриф с дорожками и бейджами происхождения, отделяющими измеренное от намеренного.
  • ★16 RobZombAI/H3MLX медиа вне темы — видеогенерация MiniMax-H3 на Apple Silicon плюс скилл к ней.
  • ★15 Unknown-333/awesome-data-engineering-skills данные 36 скиллов по dbt, Airflow, Dagster, Spark, Snowflake, Iceberg с упором на идемпотентность и бэкфилл.
  • ★15 mikefutia/brand-studio-claude-skill дизайн брендинг-студия скиллом; описание в репозитории отсутствует.
  • ★14 techjanitor/botmaker мульти-агентность скилл Hermes Agent, единственная задача которого — порождать других специализированных ботов.
  • ★13 alchaincyf/huashu-report документация генератор исследовательских отчётов институционального уровня, спецификация выведена обратной разработкой 42 отчётов Stanford, McKinsey, BCG, PwC и World Bank.
  • ★13 dreamers-laboratory/useful-skills-playbook процесс 27 обкатанных в проде скиллов в 11 категориях.
  • ★13 simonlin1212/FactReach интеграция поисковый скилл по 23 каналам (веб, X, Reddit, YouTube, GitHub, китайские площадки) с приоритетом на источники без авторизации.
  • ★11 MotleyWildside/explain-for-dumb процесс объясняет изменения в коде человеческим языком в двух режимах: история «для чайников» и разбор по файлам.
  • ★10kaisa-kucherenko/claude-code-flowпроцесс — рабочая обвязка тимлида, выложенная как есть из собственного ~/.claude: output style против многословности, хук ре-инъекции персоны против дрейфа на длинном контексте и пара скиллов handoff/pickup как осознанная замена /compact — вы решаете, что переживёт переключение, следующая сессия сверяет это с реальностью.
  • ★10 bahni-m/code-with-quran прочее вне темы — читалка Корана в соседней панели, продвигающаяся на один аят за промпт.

Инструменты

Плагины и проекты 10 из 12 · ★30+

Инструменты вокруг агента: оркестраторы, интеграции, измерение работы и контроль расхода.

★1213

cbrock84/headcount мульти-агентность

Главная находка окна и самый звёздный репозиторий за несколько прогонов. Агентная организация для Claude Code, устроенная как компания: генеральный директор над 16 департаментами, 172 скилла суммарно. Ключевое инженерное решение — каждый департамент это отдельно устанавливаемый плагин, так что проект подгружает только нужные функции, а не всю библиотеку разом; скиллы адресуются как department:skill (security:threat-modeling, finance:unit-economics), поэтому имена не сталкиваются. Скиллы подгружаются сами по совпадению запроса: «почему этот лендинг не конвертит» поднимает demand-generation:landing-page-cro-expert, «можем ли мы позволить себе этот найм» — finance:unit-economics. Есть интерактивная оргсхема с поиском по всем скиллам. Это прямой ответ на проблему, о которой серия писала не раз: библиотека в сотню скиллов съедает контекст одними описаниями — здесь она нарезана на устанавливаемые куски. MIT, 10 МБ, создан 28.08.

★212

damejan80/tokentabнаблюдаемость

Читает логи сессий, которые Claude Code, Codex, Cursor и Gemini CLI и так оставляют на диске, и сводит расход токенов и стоимость — по модели, по проекту, по дню и по типу работы. Всё локально: ни аккаунта, ни API-ключа, наружу ничего не уходит. Есть текстовый вывод (цвет автоматически отключается при пайпе), --json и веб-дашборд на localhost:4747, читающий с диска на каждый запрос. Cursor заявлен, но фактически заглушка — автор это в README не скрывает. Python, MIT, 317 КБ.

Но главное в этой позиции — не функциональность. В дайджесте 18.08 под тем же именем tokentab и с практически тем же описанием фигурировал репозиторий wzchav/tokentab ★222; на момент этого прогона он отдаёт 404. Новый damejan80/tokentab создан 27.08 в 14:16 UTC, весь его git-лог — шесть коммитов за четыре минуты (14:16 → 14:20), один контрибьютор, и ★212 набраны за сутки. Утверждать, что это копия, оснований нет — это может быть тот же автор, перезаливший проект под новым аккаунтом. Но по форме след совпадает с сюжетом watermark-remover из прошлого прогона: репозиторий из предыдущего дайджеста исчезает, его место с тем же описанием занимает новый и за сутки-двое собирает сопоставимое число звёзд.

★121

frontier-harness-eval/eval оценка организация

Публичные результаты и определения задач бенчмарка FrontierHarness Eval: одну и ту же модель (Kimi K3) прогнали через девять харнессов кодовых агентов в 12 конфигурациях на 30 одинаковых задачах — 360 прогонов. Содержательный разбор результатов — в разделе «Статьи и подходы»; здесь важно, что в репозитории лежат tasks/, results/, benchmark.json, cli/ и skills/, то есть бенчмарк воспроизводим и на свой харнесс его натравить можно. Без лицензии.

★105

ashutoshsinghpr7/wikiskill память

См. разбор в блоке «Скиллы» — репозиторий одновременно и питон-пакет с CLI, и набор скиллов, поэтому упомянут в обоих местах; в счётчик каталога включён один раз, по блоку скиллов.

★99

nickname21kmr/gameops-investigator интеграция

Агент расследования инцидентов в игровых операциях, построенный вокруг двух принципов: инструменты MCP только на чтение и воспроизводимые оценки. Первое — редкий и правильный выбор для агента, которого пускают в продакшен-данные: он физически не может ничего сломать. Второе подкреплено директорией evals/ в репозитории. Внутри — приложение на Streamlit, .mcp.json, prompts/, artifacts/, скрипты установки под Windows. 8 МБ, Python, MIT.

★96

UditAkhourii/cdafконтекст-инженерия

Единственная позиция окна, которая пытается быть форматом, а не инструментом. CDAF (Cached Descriptive Asset Files) — открытый sidecar-формат для видео: рядом с видеофайлом лежит текстовое описание с таймкодами и тем же базовым именем. Сгенерировал один раз — и каждый следующий агент, которому нужно это видео, читает несколько сотен текстовых токенов вместо полного прохода видео-понимания. Скилл ставится одной командой npx cdaf-skill и учит агента проверять наличие .cdaf-сайдкара и сверять его с хешем видео до того, как тратить токены на просмотр.

Заявлен воспроизводимый бенчмарк на gemini-2.5-flash, 20 вопросов: ответ из сайдкара дал 20/20 против 19/20 у прямого анализа видео при 10.1× меньше промпт-токенов на вопрос (303 против 3066) и примерно на 35% меньшей задержке; отношение растёт линейно с длиной клипа (~50× на 60 секундах). Бенчмарк не перезапускался — цифры авторские. Компонентов четыре: нормативная спецификация SPEC.md v1.0, Python-движок, CLI и собственно agent skill. MIT, есть CI-тесты. По сути это тот же приём, что стоит за workflow-authoring в 2.1.248, только применённый к медиа: вынести дорогое описание из горячего пути и заменить дешёвой ссылкой на него.

★67

sharith45/atlas-Assistant ассистент вне темы агент-разработки

Локальный персональный ассистент на испанском: голосовое общение, управление WhatsApp, приём звонков, поиск в вебе, память. Позиционируется как приватный и автономный, без облака. К агент-разработке отношения не имеет, в каталоге — по звёздам. Без лицензии.

★53

vicoa-ai/vicoa мульти-агентность организация

Открытый оркестратор («ADE») для управления командой кодовых агентов с любого устройства — десктоп, мобильный, VPS, самохостинг. Поддерживает Claude Code, Codex, OpenCode, Gemini, Cursor, GitHub Copilot, Kimi и Hermes бок о бок в одном рабочем пространстве. Инженерно интересны две вещи: каждый агент получает собственный git worktree и ветку, так что несколько агентов работают с одним репозиторием не мешая друг другу, и единый командный центр со статусом всех сессий вместо охоты по вкладкам терминала. Слоган — «начни за столом, рули из кармана». 47 МБ, Python, AGPL-3.0.

★52

semihtalii/brink квоты

Ядро квотного кластера окна. Нативная утилита на Swift, показывающая лимиты Claude Code, Codex и Cursor по краю экрана на macOS и Windows — и, что полезнее, какой проект их израсходовал. Именно эта разбивка по проектам отличает его от десятка соседних счётчиков. Есть релизы, CHANGELOG, упаковка под обе платформы. MIT.

★48

gesta-run/subpool квоты организация

Лёгкий самохостящийся пул AI-подписок для команд на Go: вместо того чтобы каждый разработчик упирался в свой лимит, подписки складываются в общий пул. Взрослая сборка — DESIGN.md, миграции, compose-файлы, deploy/, веб-морда. Apache-2.0. Вместе с claude-rotate это уже отдельный жанр: инфраструктура перераспределения лимитов внутри команды.

Показать остальные 2 позиции и 16 строк ★ 10–30
★46

ARahim3/kaggle-tpu-lab инфраструктура вне темы агент-разработки

Qwen3.8-27B на бесплатном Kaggle TPU с OpenAI-совместимым эндпоинтом, 262k контекста и ~130 токенов в секунду; работает с Claude Code, Codex, Opencode и Pi. По сути — способ подкладывать под кодовые агенты бесплатную модель, то есть тот же квотный сюжет с другой стороны. MIT.

★43

qunqin24/Pulse квоты

Плавающий монитор для macOS на Swift, показывающий остаток по Claude Code, Codex, Antigravity, OpenCode Go и Kimi Code сразу. Отличается от brink широтой охвата провайдеров, а не глубиной разбивки. Есть appcast для автообновления, релизы, README на английском и китайском. Apache-2.0.

★10–30 — одной строкой

  • ★24 Taimoorkhan1122/prod-readiness код-качество аудит готовности к проду семью параллельными агентами: безопасность, надёжность, тесты, DevOps, блокеры запуска.
  • ★22 Dixie-sketch/Clawdeck наблюдаемость фоновая панель статуса Claude Code для Corsair Xeneon Edge: виджет iCUE плюс локальный компаньон под Windows.
  • ★15 nickelsec/bough наблюдаемость читает историю Claude Code и показывает, что на самом деле было сделано; локально, один бинарник.
  • ★14 chengmarc/wechat-to-ai интеграция локальный экспорт переписок WeChat для скармливания агенту, без облака и телеметрии.
  • ★13 doxaras/claude-rotate квоты ротирующий прокси на несколько аккаунтов с обработкой 429 и удержанием до сброса лимита.
  • ★11 Renly1994/Skillbox процесс локальный менеджер агентных скиллов без аккаунта: «поставил один скилл — и всё».
  • ★11 icesword0760/matou мульти-агентность десктопный мультиагентный верстак для Claude Code на macOS: визуализация DAG, взаимодействие между карточками, Agent HUD, git worktree.
  • ★11 justhalfbit/dsh-plugin-memory память межсессионная Markdown-память с постепенным раскрытием тематических файлов и фоновой дистилляцией; автор прямо пишет, что механика выровнена по auto memory в Claude Code.
  • ★11 llm-net/soc-agent инфраструктура вне темы — AI-шлюз на собственном ARM-устройстве во внутренней сети.
  • ★11 mathdevie/devie-ai-quota-tracker квоты дашборд и менюбар для квот Claude Code, Codex, Gemini CLI, Copilot и Cursor с поддержкой нескольких аккаунтов.
  • ★11 opencrew-ai/opencrew мульти-агентность превращает одну подписку Claude Code в команду агентов, работающих параллельно, в Slack-подобном интерфейсе, где каждое рискованное действие требует подтверждения.
  • ★11 permgps/herdr-telegram-agents интеграция управление кодовыми агентами из Telegram: топик на агента, статус в иконке топика, инлайн-кнопки для выбора.
  • ★10jameskomo/config-drift-checkerпроцесс — «CI для вашей агентной обвязки», и по содержанию это самая существенная позиция каталога, хотя по звёздам она в самом низу: CLAUDE.md, скиллы и хуки — это конфигурация, которую другие меняют у вас под ногами (CLI выпустил 25 версий за 30 дней перед написанием инструмента, модель за алиасом sonnet меняется на сервере без changelog, коллега правит скилл в PR, который никто не тестирует), — поэтому «что обвязка обязана делать» превращается в тест-кейсы в собственном формате Anthropic claude plugin eval (промпт плюс грейдеры: regex, использование инструмента, файл, LLM-рубрика), прогоняется на каждом релизе CLI (вотчер опрашивает npm), на каждом PR и по требованию в одноразовом воркспейсе, сравнивается с базовой линией (галочка, комментарий в PR, алерт, HTML-отчёт, дашборд по версиям на GitHub Pages) и — главное — прогоняется ablation, теми же кейсами с плагином и без, чтобы дельта показала, сколько на самом деле стоит каждый скилл и хук: в демо автора стабильно срабатывает только guard-хук.
  • ★10herliansyah/9router-auto-freeинтеграция — агрегирует 100+ бесплатных моделей для кодинга, проверяет их живыми пре-тестами через 9router, ранжирует по кодинг-бенчмаркам и задержке и подставляет в готовые комбо для Cursor, Claude Code и Cline; учётные данные читаются из уже настроенной SQLite-базы 9router, в репозитории ключи не хранятся.
  • ★10 m-sanchez/clawdeck наблюдаемость локальный дашборд Claude Code без зависимостей: сессии, события, стоимость, worktree, ревью.
  • ★10 wynx1123/ai-welfare-hub квоты вне темы — навигатор по бесплатным AI-прокси-станциям с автопроверкой живости каждые 6 часов.

В завершение

Исследования и наблюдения 4 из 12

Короткие наблюдения, научные статьи и подходы — без попытки сделать их главной темой выпуска.

162HN

Show HN: We built open OpenRouter that turns usage into a better model27.08

Открытый шлюз моделей, дающий единый control plane поверх закрытых, открытых, локальных и собственных моделей. Заголовок обещает больше, чем описание репозитория: «превращает использование в лучшую модель» — то есть трафик через шлюз становится сырьём для дообучения. По описанию репозитория этот контур подтвердить нельзя, сам код в этом прогоне не читался, поэтому механика дообучения — по вторичным источникам, не подтверждено. Репозиторий создан 24.06.2026 (★588) и в каталог окна по дате не идёт; в дайджест попадает как сюжет обсуждения.

447HN

The load-bearing vocabulary of Claude27.08

Лучший материал окна и редкий случай, когда «AI пишет код» измеряют не опросом, а корпусом. Луи Абрахам берёт описания пул-реквестов на GitHub и группирует их по словам, которыми они написаны, а не по тому, что в них искали: получается десять способов письма, и каждое описание принадлежит одному из них. Главный результат одной строкой: один из десяти составлял 0.7% корпуса в начале 2025 года и 39% к середине 2026-го. Корпус на момент чтения — 603 собранных дня, 595 из них в 85 полных неделях (2026-01-06 … 2026-08-17), 461 121 описание, 51 млн словоупотреблений, 19 798 слов выше порога.

Методическая часть здесь интереснее вывода, и её стоит унести отдельно. Во-первых, GH Archive для такой задачи больше не работает: с середины 2025-го поток событий несёт почти только PushEvent (полный час 2024-08-12 — 13 555 IssueCommentEvent против 86 за тот же час 2026-08-10), а пуши текста не несут, поскольку GitHub убрал массив коммитов в октябре 2025. Автор пишет, что нашёл это дорого: ранняя версия проекта, построенная на архиве, отчиталась о 17 документах со словом load-bearing — ошибка в 158 раз, комментарии исчезли из фида, а не с GitHub. Работает вместо этого search API, потому что created: принимает не только даты, но и таймстемпы: десять пятиминутных окон в сутки, по одному из каждых 2.4 часа, старты разыгрываются с точностью до секунды и с посевом от даты (раньше они были кратны пяти минутам — то есть ровно той гранулярности, на которой срабатывает cron, и каждое окно открывалось в момент, когда автоматика массово открывает PR).

Во-вторых, порог на слово считает людей, а не появления: слово входит в словарь, когда его написали 50 различных аккаунтов. Иллюстрация в статье исчерпывающая — store-path с 242 появлениями от 2 аккаунтов отброшен, а load-bearing с 1011 появлений от 848 аккаунтов оставлен: «слово, за которым потянулись 848 человек, — это слово; слово в 242 описаниях от 2 аккаунтов — это один документ, написанный 242 раза». В-третьих, антиспам-правила применяются к людям на тех же условиях, что к ботам: не более трёх описаний от одного автора в неделю — это потолок, а не исключение. Ограничение автор называет сам: день 2026 года держит около 460 тыс. подходящих PR, пятиминутное окно — около 1250, а страница выдаёт сотню, так что окно усечено до ста самых ранних — это выборка, а не перепись. Побочная находка, которая разойдётся отдельно от статьи: длинное тире — 0.2 появления на 10 000 слов в начале 2024 года против 123 в середине 2026-го.

—simonw

Breaking Claude Code Opus 5 Auto Mode27.08

Самая существенная для агент-разработки находка окна по безопасности; на HN не попала, найдена через simonwillison.net. Auto mode — режим, который с середины августа 2026 стал в Claude Code режимом по умолчанию и заменяет человеческие подтверждения классификатором безопасности. Йоханн Рехбергер показывает рабочую цепочку исполнения кода в обход этого классификатора, и устройство цепочки поучительнее самого факта:

  1. Сервер отвечает HTTP 415, подталкивая Claude уйти с WebFetch на bash/curl.
  2. Пользователя ведут к ZIP-архиву с закодированными записями.
  3. Claude отказывается запускать приложенный бинарный декодер — и вместо него пишет собственную замену на Python.
  4. Декодер запускается из распакованной директории, где лежит вредоносный struct.py, затеняющий одноимённый модуль стандартной библиотеки.
  5. Импорт base64 внутри своего же декодера тянет отравленный struct.py и исполняет обфусцированную нагрузку; дальше — удалённый стейджер и C2.

Фраза, ради которой стоит читать оригинал: «Claude не доверяет приложенному бинарному декодеру, но доверяет тому, который написал сам». Заявленный успех — 60–80% на трёх вариантах атаки, но автор честно оговаривает выборку: 3–5 прогонов на вариант, «это малые выборки, а не универсальное измерение ASR». Отдельный сюжет — реакция: отчёт ушёл в баг-баунти Anthropic, ответа не было, был отправлен повторно через канал безопасности и закрыт как «Informative» с формулировкой, что auto mode — «удобство, опирающееся на классификатор с лучшими намерениями, а не гарантия безопасности», а настоящая граница — изоляция ОС и контроль исходящего трафика. Рядом автор приводит заказанную Anthropic стороннюю оценку, показавшую 0.00% успеха атак на Opus 5 в auto mode на 72 сценариях, и снимает противоречие одной фразой: атака работает именно потому, что лежит вне фиксированного набора бенчмарка — «0.00% на бенчмарке и рабочий RCE истинны одновременно».

Практический вывод автора: запускать неприсмотренных агентов в контейнере, VM или песочнице ОС, жёстко резать исходящий трафик, держать секреты вне рантайма агента, ставить явные ask/deny-правила вокруг создания процессов и никогда не принимать одобрение auto mode за доказательство безопасности. Классификатор — не песочница.

68HN

Terminal-Bench-Science28.08

Бенчмарк агентов на настоящих научных workflow, а не на игрушечных задачах. Ведут исследователи Стэнфорда, строит команда Terminal-Bench вместе с предметными специалистами; заявлено 376 участников из 22 стран в предложении, ревью или реализации задач. Версия 0.1 — 70 задач, прошедших экспертную проверку, по пяти областям: науки о жизни (19), физические (17), математические (17), науки о Земле (8), инженерные (9); измеряются конкретные исследовательские результаты — анализы, симуляции, код, наборы данных. Результаты отрезвляющие: Claude Opus 5 — 30.0%, GPT-5.6 Sol — 22.4%, Claude Fable 5 — 21.4%, Claude Opus 4.8 — 10.5%, сильнейшая открытая модель GLM 5.3 — 8.1%. Относительно Terminal-Bench 3.0 доля решённых задач упала более чем на 10 процентных пунктов у всех протестированных моделей при сохранении различающей способности — то есть сложность подняли намеренно и с контролем. Полезно как трезвая точка отсчёта на фоне прогнозов из следующего пункта.

Показать остальные 8 материалов
66HN

Six months of writing code exclusively with agents27.08

Полгода по строгому правилу: не писать код руками вообще — задача описывается агенту, результат правится промптами, а не редактором. Инженерная часть обвязки описана конкретно и стоит внимания больше, чем сам зарок. Каждый агент живёт в отдельной одноразовой виртуальной машине, где может свободно запускать bash; внешний доступ (API, базы, учётные данные) идёт через прокси, подставляющие секреты, так что агент их не видит. Поверх этого автор построил botd — централизованное управление: поднимает VM, отслеживает прогресс, хранит историю разговоров, и за счёт этого работу можно вести с телефона, пока агенты продолжают после закрытия ноутбука.

Валидация двухслойная: агенты сами гоняют тесты, CI и браузерные проверки, но затем автор руками смотрит работающее приложение — потому что агент уверенно доставляет «не то», если неверно понял требование. Ревью как жанр у него переехало: обсуждение архитектуры и компромиссов до написания кода («agentic engineering»), а к моменту появления кода решения уже зафиксированы контрактами и тестами. Два предупреждения. Первое — «летальная тройка»: недоверенный контент, приватные данные и внешняя коммуникация вместе; отсюда изоляция сред и контроль сочетаний инструментов. Второе, менее ожидаемое: автор выбрасывал готовые, протестированные фичи, потому что они дублировали имеющееся или добавляли лишнюю сложность — автоматическая валидация не отвечает на вопрос, должна ли эта вещь существовать, а «расшипить» тяжелее, чем зашипить. Цена, которую он называет прямо: глубокое знание каждой строки исчезло, взамен появилась возможность допросить историю разговоров с агентами и восстановить причины решений.

—simonw

The end of programming25.08

Пол Дикс (создатель InfluxDB) утверждает, что ручное написание кода и человеческое код-ревью устареют: агенты будут производить большую часть работающего софта, а люди станут проверять результат, а не код. Прогнозы даны с датами — новые фронтир-модели к сентябрю 2026-го и к концу года; за 2–3 года удешевление и ускорение генерации токенов в 10–100 раз; к 2027–2028 самые продуктивные разработчики управляют системами, а не пишут код; за десятилетие машинно-сгенерированного продакшн-кода станет больше, чем написанного людьми. На своих проектах он приводит две сложные фичи InfluxDB (интеграция с Iceberg и репликация данных на периферию), сделанные за 14 и 28 часов в рамках обычного недельного лимита токенов.

Опорный пример — переписывание Bun с Zig на Rust, которое Саймон Уиллисон процитировал из этой статьи: «тот факт, что AI написал 1 млн строк и потом дорабатывал их пару месяцев до надёжного софта, который сейчас крутится на миллионах машин разработчиков, абсолютно поразителен». Здесь нужна оговорка: сам эпизод — июль 2026 года, то есть вне окна, а цифры в разных пересказах расходятся (у Дикса — 1 009 257 добавленных строк и 6778 коммитов за 11 дней при ~$165 тыс. расходов на токены; в других изложениях — около 550 тыс. портированных строк, ~780 тыс. строк Rust на выходе, 6500 коммитов, 64 параллельных агента). Первичный отчёт Джарреда Самнера в этом прогоне не читался: числа по Bun — по вторичным источникам, не подтверждено. Аргумент Дикса приведён по его собственной статье.

01.09RUNTA

FrontierHarness Eval

Самый практически ценный материал окна, и единственный, который меняет решение о том, чем работать. Shilin Zhu и Shiqi Mei прогнали одну и ту же модель Kimi K3 через девять харнессов кодовых агентов (12 конфигураций) на 30 одинаковых задачах по разработке и работе в терминале — 360 прогонов. Модель, задачи и рантайм held constant, менялся только харнесс.

Результат: доля решённых задач у всех 12 конфигураций близка — от 50,0% до 66,7%, разброс в 17 пунктов. А стоимость решённой задачи различается от $1.05 до $18.34, то есть в 17,5 раза.

Claude Code в этой таблице — самый дорогой: pass rate 63,3% (вровень с DSH Creator), но $18.34 за решённую задачу против $3.28 у DSH Creator и $3.47 у Codex, при медианном времени 9 мин 38 с. Ключ к объяснению — кеш: у Claude Code доля попаданий в кеш, взвешенная по токенам, 25,0% против 91,6–99,1% у остальных. Авторы честно оговаривают, что это скорее про несовпадение харнесса и модели, чем про дефект харнесса: Claude Code проектировался под явное кеширование моделей Anthropic, а тестировали его на неявном префиксном кеше Kimi K3. Иными словами, число $18.34 нельзя переносить на Claude Code с Opus или Fable — но сам вывод «харнесс стоит дороже, чем кажется, и цена прячется в кеше» переносится полностью. Определения задач и результаты выложены, бенчмарк можно натравить на свой харнесс.

212ОЧКОВ HN

Which tools do Claude, Codex and Cursor choose? · 03.09

Armature измерила, какие сторонние сервисы кодовые агенты рекомендуют и ставят. Масштаб серьёзный: 75 репозиториев на 10 языках, 1163 вариации промпта, четыре персоны пользователя (вайб-кодер, джун, сеньор, энтерпрайз-инженер), «симулированный человек в цикле» на Gemini 3.7 Flash, три провайдера песочниц. Из 16 893 прогонов в анализ попали 5292 валидных сессии по 51 кодовой базе.

Главное число: все три агента выбирают один и тот же инструмент лишь в 42% ячеек. То есть выбор технологии в заметной степени определяется не задачей, а тем, какой агент открыт. Различаются и источники решения: Claude Code опирается на обучающие данные и ищет в вебе примерно в 30% случаев, Codex ищет в вебе в 94%, Cursor опирается на веб примерно в двух третях случаев. Контекст решает больше, чем репутация: победитель по отправке почты меняется с языком — Resend в TypeScript, Sendgrid в Python, Postmark в Go, Azure в Java. И отдельно — упоминания не равны выбору: PayPal получил 139 упоминаний и ноль выборов, LangChain — 194 упоминания и 4 выбора.

Практический вывод для тех, кто держит скиллы: если стек не закреплён явно в CLAUDE.md или скилле, его за вас выберет статистика обучающей выборки конкретного агента.

72ОЧКА HN

Grep beats LSP? Why coding agents ignore your fancier tools · на HN 04.09; страница датирована 12.08

Автор — Pengcheng Xu. Расхождение дат отмечаю явно: сама страница указывает 12 августа, то есть статья старше окна и всплыла на HN только 04.09; в дайджест попадает по волне обсуждения, а не по дате публикации.

Тезис: агенты игнорируют LSP не потому, что он хуже, а потому, что grep «дружелюбнее к модели». Формулировка автора — инструмент дружелюбен не когда его результат точен, а когда он возвращает достаточно контекста для следующего шага и подаёт его в форме, которую модель может использовать напрямую.

Измерения, которые это подкрепляют: на простых задачах локализации кода модели выбирали семантические инструменты в 0–6% случаев, а на задачах полноты поиска ссылок — уже в 45–57%, то есть маршрутизация по типу задачи у агентов есть. Когда в вывод LSP добавили инлайновый исходный контекст вместо голых координат файлов, доля успеха выросла с 0,67 до 0,83, а число дочитываний файлов упало с 15,2 до 3,2 за эпизод. И ценность зависит от шума в кодовой базе: на чистых репозиториях LSP был чистыми накладными расходами, на шумных дал +0,246 к F1.

Итоговая формула автора — «способность агента = модель × харнесс» — прямо рифмуется с выводом FrontierHarness Eval, и вместе они образуют главный методический сюжет окна: харнесс перестал быть деталью реализации.

49ОЧКОВ HN

AI Agents and the Refactoring That Never Happens · 02.09

Rodrigo Rosenfeld Rosas формулирует неочевидный риск. Модульность, инкапсуляция и слоистость, пишет он, «не эстетические предпочтения, а уступки объёму человеческой рабочей памяти». Исторически именно человеческий предел работал сигналом: когда разработчик переставал понимать код, он останавливался и рефакторил. Агенты этот предел снимают — они разбираются в мешанине, которая остановила бы человека. Сигнал исчезает, а вместе с ним и рефакторинг, и команда приходит к системе, ключевые части которой не может целиком осмыслить ни один разработчик.

Контраргумент к позиции «ну и пусть, агент же справляется» автор строит экономически: чистый модульный код дешевле в токенах и точнее в работе агента. Предложение — сознательно вернуть дисциплину рефакторинга и встроить в агентные харнессы флаг на неподдерживаемую сложность. Практически это ложится в ту же линию, что Socialpranker/zodchiy из каталога, где находка допускается только после измерения её цены.

58ОЧКОВ HN

How Warp builds self-improving agents on Claude · 26.08, на HN 29.08

Публикация датирована 26 августа — на два дня раньше окна; в дайджест попадает по обсуждению 29.08. Warp (около 800 тыс. разработчиков в месяц, 10 млн сессий Claude Code) описывает схему из двух скиллов против проблемы «обратная связь умирает вместе с сессией»:

  • Базовый скилл держит доменное знание и инструкции — например, правила ревью кода.
  • Скилл-улучшатель запускается по расписанию, смотрит на накопленную человеческую обратную связь, сравнивает вывод агента с реакциями на него и предлагает небольшие точечные правки к базовому скиллу.

Правки идут через обычный code review, то есть человек остаётся в цикле. Формулировка основателя Zach Lloyd: «файловые скиллы — способ закодировать знание для агентов, не помещая это знание прямо в промпт». Схема почти дословно совпадает с циклом WikiSkill из каталога, только вместо автоматического гейта на отложенных задачах здесь гейтом служит человеческое ревью — полезное сопоставление двух способов замкнуть одну и ту же петлю.

209ОЧКОВ HN

Session URL в коммит-сообщениях · issue от 09.06, на HN 30.08

Не статья, а обсуждение, но по последствиям для практики значимое. Claude Code по умолчанию дописывал ссылку на сессию (https://claude.ai/code/session_...) в каждое коммит-сообщение и описание PR — без явного согласия и без упоминания при онбординге. Issue заведён 09.06, закрыт как выполненный 17.08, то есть к моменту всплеска на HN 30.08 проблема уже была решена; волна обсуждения догнала исправление с опозданием в две недели. В комментариях (115 реакций, 24 комментария) поднимался вопрос о совместимости такого поведения с GDPR — это оценка участников обсуждения, не юридический вывод. Практический остаток: подавляется настройкой attribution.commit: "" в .claude/settings.json.

Замечено, но не подтверждено

  • Tell HN: Man, AI is killing my brain (50 очков, 27.08) — тред о когнитивной цене постоянной работы с агентами. Обсуждение, а не материал; содержание треда не разбиралось, приведено как индикатор темы, набирающей вес рядом с постом exe.dev.
  • WebSearch по подходам агент-разработки дал только недатированные обзоры и SEO-агрегаторы; единственная содержательная наводка — alexop.dev о детерминированной оркестрации — датирована 28 мая 2026 года и в окно не входит. Подробнее в «Как собран выпуск».

Замечено, но не подтверждено

Веб-поиск по подходам агент-разработки вывел на сводку, утверждающую, что «GPT-5.5 достигает 62% на бенчмарке композиции оркестраторских промптов при среднем 14,9% по 27 коммерческим моделям», и что контекст Claude — 200K. Второе точно неверно (Fable 5.1 — 1M, см. CHANGELOG 2.1.257), первое дано без проверяемого первоисточника. Оба утверждения — по вторичным источникам, не подтверждено; в дайджест как факты не берутся, в выпуск не взяты как пример шума SEO-агрегаторов.

Проверка

Источники

Ссылки на первичные материалы, поисковые запросы и данные, использованные в выпуске.

Открыть полный список источников

github.com/anthropics/skills — коммиты за окно · claude-plugins-official/pull/5641 · PR #5609 · PR #5610 · PR #5611 · github.com/anthropics/claude-code — CHANGELOG.md · louisabraham.github.io/load-bearing · github.com/louisabraham/load-bearing · embracethered.com — Breaking Claude Code Opus 5 Auto Mode · terminal-bench-science.ai — announcement · blog.exe.dev — Six months of writing code exclusively with agents · pauldix.com — The end of programming · simonwillison.net/2026/Aug/26/paul-dix/ · simonwillison.net/2026/Aug/26/ · simonwillison.net/2026/Aug/27/ · github.com/experientiallabs/experiential · github.com/kelviq/tare · github.com/calmrocks/ai-engineer-notebooks · alexop.dev — Claude Code Workflows · github.com/anthropics/skills · skills/pull/1704 · skills/pull/1713 · github.com/anthropics/claude-plugins-official · PR #5634 · PR #5728 · PR #5738 · claude-code/issues/66504 · raw.githubusercontent.com — claude-code CHANGELOG.md · anthropic.com — Claude Fable 5.1 и Mythos 5.1 · claude.com/blog — How Warp builds self-improving agents · claude.com/blog — Claude for Commerce Agents · openai.com — GPT-6 Astra · status.claude.com — инцидент 03.09 · runta.com — Introducing FrontierHarness Eval · armature.tech — Which tools coding agents install · agentconnect.md — Grep beats LSP? · rosenfeld.page — AI Agents and the Refactoring That Never Happens · arxiv.org/abs/2608.27454 — WikiSkill · medium.com/@lukicov — Your documentation is a build artifact · simonwillison.net/2026/Sep/