← Назад

Agent Briefing · выпуск 05

Скиллы и плагины недели

Berkeley измерила 21 пару модель–обвязка: успешность от харнесса почти не зависит, а цена отличается вдвое — а в CLI появился claude plugin eval, первый способ прогнать проверки плагина замером из самого CLI.

Период11 – 18 сентября
Прошли отбор67 репозиториев
Скиллы ★30+21
Плагины ★30+13

Что вышло и что обсуждали

Релизы и обсуждения

Версии платформы за окно и сюжеты, вокруг которых шёл разговор. Каталог находок — в разделах ниже.

Claude Code 2.1.269 → 2.1.276 — 8 релизов

  • claude plugin eval (2.1.269) — прогоняет набор проверок плагина против самого Claude Code и выдаёт воспроизводимый результат со счётом — JSON и HTML-отчёт. Проверка плагина замером переезжает в сам CLI: раньше это делалось внешними наборами вроде того, что умеет скилл skill-creator.
  • Скиллы и плагины аккаунта claude.ai синхронизируются в терминал (2.1.275) — то, что включено в веб-аккаунте, приезжает в сессию CLI; отключается syncClaudeAiSkills: false и syncClaudeAiPlugins: false. Библиотека скиллов перестаёт быть отдельной на каждой машине.
  • omitClaudeMd во фронтматтере агента (2.1.271) — субагент можно запустить без пользовательских, проектных и локальных CLAUDE.md — управляемые политики при этом грузятся. Способ дать субагенту чистый контекст, не вычищая репозиторий.
  • Плагины из npm ставятся с --ignore-scripts и проверкой целостности (2.1.275) — install-скрипты пакета больше не выполняются при установке плагина. Плюс --accept-command <sha256> (2.1.271) — принять ровно ту команду, которую показал предыдущий прогон, вместо -y.
  • Авторежим: allowed_domains у отдельной команды (2.1.271) — Bash, PowerShell и Monitor в песочнице получают ровно те хосты, которые нужны команде, и только ей; остальные отклоняются. Там же — передача результата субагента через отдельный вызов, который просматривает классификатор.
Остальные изменения CLI
  • Расход и лимиты: размер динамического воркфлоу по умолчанию — small на Pro, ориентир medium снижен с 15 до 10 агентов; CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS (1–256) поднимает предел параллельных агентов на прогон (2.1.269, 2.1.271).
  • Ревью: /code-review для моделей без собственных настроек перешёл на компактные инлайн-промпты вместо пачки субагентов-ревьюеров (2.1.274).
  • Наблюдаемость: OTEL_LOG_TOOL_DETAILS=1 теперь кладёт настоящие имена агентов, скиллов, плагинов и MCP-серверов в метрики стоимости и токенов; у трейса claude_code.llm_request появился атрибут effort (2.1.273, 2.1.274).
  • Шлюзы: заголовки-подсказки x-claude-code-request-class, -agent-type, -compaction, -context-compacted для LLM-шлюзов, по флагу CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 (2.1.273).
  • Monitor: у наблюдения всегда есть дедлайн (не больше 30 минут, 10 в одиночном -p), бессрочный persistent убран; финальный вывод скрипта и его выход приходят одним уведомлением, экономя ход модели (2.1.271, 2.1.274).
  • Гигиена секретов: сообщения, логи и claude plugin marketplace list больше не показывают пароль или токен, зашитый в git-, ssh- или marketplace-URL (2.1.275).
  • Скиллы, синхронизированные с claude.ai, в облачных сессиях называются anthropic-skills:<имя> — как в Claude Desktop (2.1.269).
  • Версии 2.1.270, 2.1.272 и 2.1.276 — точечные исправления регрессий предыдущей сборки.

Модели — релизов в окне нет

Релизов моделей в окне нет. Платформенное вместо них — слияние Claude Cowork с чатом в одно приложение (16.09): выбирать между двумя интерфейсами больше не нужно, Claude сам решает, что задаче требуется, а скиллы, коннекторы и контекст остаются доступны из любого разговора. Там же в бете на платных планах — Claude Docs, Claude Slides и встроенный Claude Design. Раскатка на Pro и Max идёт неделями, Team и Free — следом, корпоративным клиентам обещано предупреждение за 30+ дней.

Сюжеты недели

Разборы — в «Исследованиях и наблюдениях» в конце выпуска.

От разработчиков платформы

Официальные скиллы и плагины

Изменения официальных каталогов за окно: что добавилось в anthropics/skills и в маркетплейс плагинов. Релизы CLI — в начале выпуска.

claude-plugins-official — 8 записей, 13 новых плагинов

  • Pendo (16.09) — сразу пять плагинов, и два из них — не про SaaS: setup-agent-analytics находит AI-агентов в вашей кодовой базе и обвешивает их Pendo Agent Analytics через Python-, TypeScript-SDK или другой подходящий путь, а setup-mcp-agent-analytics делает то же с MCP-сервером, чтобы вызовы его инструментов попадали в аналитику. Остальные три — продуктовая аналитика, внутриприложенные гайды и почтовые сценарии.
  • Intuit QuickBooks (16.09) — сводки финансового здоровья по P&L, денежному потоку, балансу и дебиторке с отраслевыми бенчмарками.
  • Clay (16.09) — настройка и вход в CLI Clay, запросы к таблицам и поиск по GTM-базе компании.
  • Zocks Advisor Intelligence (16.09) — семь скиллов финансового советника поверх записей встреч: поведенческие профили клиентов, ранжирование риска ухода, радар сторонних активов.
  • Leadfeeder (17.09) — сигналы посетителей сайта превращаются в воронку: ежедневные сводки, исследование компаний-посетителей, поиск контактов.
  • Informatica (16.09) — управляемый поиск по каталогу Informatica CDGC — таблицы, колонки, файлы, термины глоссария.
  • BlackRock Advisor Center (13.09) — разбор портфеля, проверка здоровья фондов, ведомый подбор бенчмарка.
  • Chronograph GP и LP (17.09) — мониторинг портфелей, оценки и прогноз денежных потоков для команд частного капитала; LP-половина — отдельным репозиторием.
  • Фоном — 174 бампа версий партнёрских плагинов за неделю, двумя пакетными прогонами 16 и 17.09.

Кого зовут в маркетплейс — наблюдение

Тринадцать новых плагинов недели — почти сплошь подключения к чужим SaaS: бухгалтерия, CRM-аналитика, отчётность фондов, портфели, разведка по лидам, каталог данных. Исключение одно и оно показательное: у Pendo два плагина из пяти работают не с внешним сервисом, а с вашим кодом — находят в нём AI-агентов и MCP-серверы и обвешивают их аналитикой, чтобы вызовы инструментов стали видимыми. Наблюдаемость самих агентов доехала до официального каталога раньше, чем туда доехали инструменты разработки: приёмы работы с агентом по-прежнему живут там, откуда взят каталог ниже, — в репозиториях отдельных людей.

Anthropic за неделю — исследования, отчёты, платформа

Новые практики

Скиллы 10 из 21 · ★30+

Что появилось за окно: сам скилл, его метод и чем он проверяет свою работу.

★ 11229

cloudflare/security-audit-skillбезопасность

Скилл Cloudflare превращает агента в аудитора по шести фазам: разведка с картой архитектуры и журналом покрытия, охота изолированными «хантерами» по дырам этого журнала, проверка каждой находки свежими верификаторами, машиночитаемый findings.json по собственной схеме, независимая сверка ссылок в записях и отчёт, не привязанный к цели. Главное правило метода — находку проверяет не тот агент, который её нашёл; вердиктов три: подтверждено с трассой до исходника, требует проверки, отклонено. Повторный прогон по тому же репозиторию добирает покрытие, а не начинает заново. Репозиторий существует с июня; на этой неделе он вышел на HN и собрал 198 очков.

★ 837

kruzovic7/ai-data-extractorданные сессий

Достаёт историю переписки из локальных хранилищ Claude Code, Cursor, Windsurf, Aider, Cline/Roo Code и Continue — по отдельному модулю на каждый инструмент, чистый Python, MIT. Полезно, когда нужно посчитать собственный расход или вытащить решение из сессии, которую давно закрыли. Осторожно со звёздами: 837 звёзд и 135 форков за неделю при единственном дне активности (создан и последний раз тронут 11.09) — сигнатура накрутки, а не признание. Код в extract.py и extractors/ прогнан через сигнатурный поиск: сетевых вызовов, subprocess, eval и base64-блобов нет.

★ 365

mcncarl/jianying-headlessвидео

Безголовая работа с проектами Jianying (китайский CapCut): изолированное редактирование и экспорт плюс отдельный agent skill поверх этого. Автор называет выложенное «превью закрытого исходника» — в репозитории есть engine/, bridge/ и skills/, но лицензия нестандартная. 187 форков за три дня при 365 звёздах — распределение тоже необычное, брать с проверкой.

★ 168

pliablepixels/gap-trapкачество кода

Отвечает на конкретную проблему: агент пишет большую часть кода, читать каждый дифф вы перестаёте, и качество уплывает одинаково во всех репозиториях — дубль уже существующего хелпера, пересечение границы слоя, тест, который проверяет, что код отработал, а не что он сделал правильное, и забытое через неделю правило из инструкций. Аргумент автора: правила в текстовом файле читает тот самый агент, который их и нарушает, поэтому gap-trap один раз читает репозиторий и ставит правила и гейты в сам репозиторий. Позиционируется как внутренний цикл рядом с SDD.

★ 96

onmyway133/claude-code-tips-tricksпрактики

Личная подборка приёмов работы с Claude Code от автора, давно пишущего про инструменты разработчика. Не скилл, а текст — но ровно того жанра, из которого скиллы потом и вырастают: что класть в CLAUDE.md, как резать задачу, где агент предсказуемо промахивается.

★ 96

kuhnhomeuk-cell/procedural-filmгенерация видео

Скилл превращает тему в 30-секундный вертикальный ролик, целиком нарисованный и озвученный на JavaScript — без видеомодели и без стоков. Эталонный ролик автора — жизнь бабочки-монарха. Интересен как образец того, что скилл может отвечать не за текст, а за детерминированный рендер.

★ 84

oguzhankayan/turkish-nativeтекст

Скилл для письма на живом турецком и вычистки «переводного» духа из локализованных и машинно-написанных текстов. Тот же приём, что у англоязычных антислоп-скиллов, но привязанный к языку, в котором машинный перевод ломается по-своему.

★ 72

beyondtahir/beyondseoмаркетинг

Комплект под SEO/AEO/GEO: собственный обход сайта, работа с контентом, конкурентами и репутацией, 206 источников публикации с контекстом по DR и планами ссылок. Авторская оговорка: нативному движку не нужны ключи API.

★ 67

Jakeschincariol/instagram-agent-skillсоцсети

Тринадцать скиллов, которые ведут аккаунт: Reels по 26 оцениваемым формулам хука, скилл исследования вирусного, линтер подписей и «очеловечиватель». MIT. Того же автора — одиннадцать скиллов под YouTube-канал (★23).

★ 62

misbahsy/anti-ai-slopтекст

Не просто переписывает черновик, а прогоняет результат через четыре ворот: невидимые символы, линтер, ревью вторым агентом и необязательная проверка моделью другого семейства; провалившийся черновик уходит на переписывание, до двух проходов. В README перечислены ловимые конструкции по пунктам — отрицательный параллелизм, «вот в чём дело», псевдоинсайт, двоеточие-раскрытие, хвостовое -ing-обобщение, назначение важности. Ценна именно таблица признаков: её можно взять и без самого скилла.

Показать остальные 11 позиций и 21 строку ★ 10–30
★ 60

jtydhr88/music-composition-skillsмузыка

Скиллы для сочинения и аранжировки популярной музыки. У того же автора рядом — скиллы для написания текстов песен (★45).

★ 58

kina-cmd/agent-skill-syncинфраструктура скиллов

Решает проблему, которая появляется у всех, кто держит больше одного агента: библиотеки SKILL.md расползаются по каталогам разных инструментов, часть — копии, часть протухла, часть тянет никогда не ставившиеся зависимости. skillsync сканирует любое число корней (~/.codex/skills/, кеш плагинов маркетплейса, ~/.claude/skills/), классифицирует найденное на A/B/C/D и синхронизирует. Чистый Python ≥ 3.11 без зависимостей.

★ 52

GPUtw-ai/GPUtw-Skillвендорский

Пакет знаний от облачного GPU-провайдера: учит Claude Code, Codex CLI, Cursor, Copilot и Gemini CLI работать с его REST API. Жанр вендорского скилла вместо вендорской документации становится массовым — см. официальный маркетплейс в разделе выше.

★ 49

ccai40359-wq/seanswarmмульти-агентность

Пакет скиллов и ролевых шаблонов без своего рантайма: протоколы исполняет сам хост-агент. Четыре сценария с проговорённым протоколом — веерное исследование (полосы → таблица утверждений → состязательная полоса → арбитраж между семействами моделей), двухканальное чтение документа (два независимых канала читают один текст и сверяются: совпадение / дополнение / конфликт), поставка разработки (список приёмки от QA → один пишущий → независимое read-only ревью по диффу → приёмка fail-closed). Самое ценное здесь — именно записанные протоколы, а не код.

★ 48

ARahim3/cachebeatрасход

Крошечный скилл держит промпт-кеш тёплым, пока сессия простаивает, чтобы следующее сообщение читалось из кеша, а не переоплачивалось целиком. Опирается на опубликованное соотношение Anthropic: чтение из кеша — 0.1× от входной ставки, то есть холодный возврат стоит примерно в десять раз дороже. Авторское наблюдение, за пределами API: на подписках Pro/Max то же самое списание съедает пятичасовое окно и недельный лимит. Родился на многодневном файнтюне, который нянчил Claude.

★ 45

jtydhr88/lyric-writing-skillsтекст

Парный к музыкальному набору того же автора комплект для написания текстов песен.

★ 44

riesaexe/r-docдокументация

Скилл поддерживает в порядке AGENTS.md и каталог docs/ — то есть ровно тот слой, который агент читает в начале каждой сессии. Задача обратная кодогенерации: не писать код, а держать актуальным его описание.

★ 44

AgriciDaniel/youtube-scoutисследование

Одна тема на входе — одна ранжированная книга исследования на выходе: поиск через YouTube Data API v3, ранжирование по просмотрам, вовлечению, динамике или прорыву, листы Videos, Channels, Summary, Comments и Transcripts с хуками и местами повторного просмотра. Показательный пример скилла, у которого результат — таблица, а не текст.

★ 39

JourniOne-ai/JourniOne-Planning-Skillsпланирование

Планирование путешествия от идеи и подневного маршрута до дневника с картой, который можно отдать другому; отели и рейсы подцепляются по необходимости. Документация китайская.

★ 30

Nhahan/WebGPTмаршрутизация

Скилл для Codex, делегирующий работу в веб-интерфейс ChatGPT. Жанр «агент, который ходит к чужой модели через её же веб-морду» на этой неделе встретился дважды — см. также agent-router в хвосте.

★ 30

NirDiamant/Agentic_Engineeringпамять

Метод в одну строку: задать агенту пять вопросов о репозитории вхолодную, собрать из реального кода небольшой слой docs/, задать те же пять вопросов ещё раз и напечатать счёт. Аргумент автора — агент читает ваш код, но не читает решений за ним: куда здесь кладут новый файл, почему эта база, а не очевидная. Явно оговаривает, что это не замена Spec Kit: тот пишет спеку и строит код из неё, а здесь читается уже написанный код. Ценна измеримость — оценка до и после на одних и тех же вопросах.

Коротко — ★ 10–30

  • ★ 29Kerneta/daidocsпамятьОткрытый текстовый формат .dai для долгой памяти ассистента: читается Claude, GPT, Gemini, Cursor, локальными моделями и grep.
  • ★ 27selmakcby/a-sirketiмульти-агентностьТри агента Claude Code, сторож и раздающий, замкнутый цикл — кнопка публикации остаётся у человека.
  • ★ 23hexiaofeier/hehe-industry-research-skill-packисследованиеОдин вход и 13 специализированных скиллов под отраслевое и корпоративное исследование на китайском.
  • ★ 23Jakeschincariol/youtube-agent-skillсоцсетиОдиннадцать скиллов на YouTube-канал: сценарии по 21 формуле хука, заголовок и превью линтуются как пара.
  • ★ 22TsCarpe/claude-sdlc-skillsпроцессПриём и аудит требований, состязательные ворота ревью, оркестрация тестов, перепроверка решений, аудит релизной конфигурации.
  • ★ 22karanb192/claude-code-modsинструментарийМоды к Claude Code и скилл-строитель для них; рядом — каталог всех модов со сканером следов (★19).
  • ★ 22lxsssssss/pdf-translateдокументыПеревод PDF с восстановлением векторной вёрстки, браузерным зондом переполнения и двусторонней сверкой; README китайский, есть английский.
  • ★ 21Shass27/stem-notesобучениеСлайды, учебники и задачники превращаются в LaTeX-шпаргалки, разобранные решения и конспекты.
  • ★ 20azizu06/ai-coding-interview-practiceобучениеДесять задач с подсаженными багами, заглушками и таймером плюс промпт интервьюера — тренировка формата собеседования с агентом.
  • ★ 20Marisha-Sahay/awesome-java-agent-skillsязыкСкиллы, наборы правил Checkstyle и Maven-гейты, заземляющие агента на корпоративные стандарты Java 21.
  • ★ 18engenheirodevideo/get-brollsвидеоСбор, разбор в раскадровке и безопасная выдача B-roll для macOS и Windows.
  • ★ 16Boriwatopal/agent-skill-remotion-motion-graphicsвидеоКинетическая типографика и бренд-промо как код на Remotion, 9:16 и 16:9 из одной кодовой базы.
  • ★ 1600200200/maintainer-skills-labинструментарий16 скиллов и 6 агентов под Codex, Claude Code, Cursor, OpenCode и Grok Bot: очеловечиватель, отладка ML, ревью PR, Skill Watch.
  • ★ 16RinDig/lecture-deck-skillобучениеАнимированные HTML-колоды лекций из раскадровки: скилл плюс Python-набор с тремя темами.
  • ★ 16TopVitamin/agent-skillsсборникСводный китайский сборник скиллов одной команды, открыт целиком.
  • ★ 12zzhzhouzhou/minimal-ui-deciderдизайнСкилл принятия решений по минималистичному UI, документация китайская.
  • ★ 11kulchankas/paranoidбезопасность/hack-me ломится в ваше же запущенное приложение, доказывает каждую дыру реальным запросом, чинит и перепроверяет.
  • ★ 11zhouwei713/title-matrixконтентМатрица заголовков под несколько площадок: генерация, диагностика, ревью, анализ.
  • ★ 11alandaitch/instagram-carousel-skillсоцсетиКарусели Instagram 1080×1350 из темы: шесть HTML-шаблонов и локальный рендер.
  • ★ 1047thtechcorner/RayCodes_HumanizerтекстЛокальный «очеловечиватель» прозы под Ollama, Claude Code и Skills CLI.
  • ★ 10liangdabiao/lego-cinematic-remixгенерация видеоОдна фраза — и скилл строит лего-городок, разыгрывает в нём сцену и снимает её кинематографично.

Инструменты

Плагины и проекты 10 из 13 · ★30+

Инструменты вокруг агента: оркестраторы, интеграции, песочницы, измерение работы и контроль расхода.

★ 3189

browser-use/jev-ultrafastбраузерный агент

Браузерный агент с динамическим индексированным пространством действий: каждое наблюдение даёт новую таблицу элементов, движок выбирает операцию и элемент, а маленькая LLM пишет текст только там, где операция — TYPE_TEXT. Авторский замер: Цюрих → Лондон на Google Flights за 7.1 секунды с учётом генерации текста и ожиданий загрузки; есть отдельная страница измерений и MP4-демо. Репозиторий создан 16.09 и за два дня собрал 3189 звёзд — в выборку по топикам Claude не попал вовсе: ровно та дыра поиска, о которой предупреждает метод этого дайджеста.

★ 305

pizza-bot-app/pizza-botфоновые агенты

Локальный «входящий ящик» для агентов, работающих в фоне: собран на DeepAgents и LangGraph. Отвечает на вопрос, который возникает сразу после первого длинного прогона, — куда агенту складывать то, что он сделал, пока вас не было. Репозиторий с июня, на этой неделе вышел Show HN (59 очков).

★ 129

ordewell/ordewellоркестрация

Одна цель превращается в упорядоченный план задач, у каждой — свой исполнитель, модель и режим; дальше план выполняется, а результаты проверяются. Прямой аналог связки «план → субагенты» внутри одного CLI, но вынесенный наружу и применимый к нескольким агентам сразу. Show HN на этой неделе, 54 очка.

★ 111

rapiddweller/datamimicтестовые данные

Модельно-управляемая генерация синтетических тестовых данных — детерминированная, без утечки персональных данных, с учётом предметной области; Python API, XML-конвейеры, интеграция через MCP. На HN его подали формулировкой, ради которой он здесь и стоит: не давайте кодовому агенту выдумывать собственный тестовый мир. Проект старый (2024), но в агентный контур его завели только сейчас.

★ 93

NiazMorshed2007/jev-reviewревью

Локальный MCP-плагин непрерывного ревью качества кода, который пишут агенты; работает на движке Jev от TypeSafe.ai. Создан 17.09. Обратите внимание на зависимость: у трёх находок этой недели — jev-review, skillranker и jev-ultrafast — в основе один сторонний движок, и двум из трёх нужен его ключ API.

★ 92

ruc-datalab/EvoOntologyданные

Плагин к Claude Code и Codex от лаборатории данных Жэньминьского университета: строит поверх разнородных таблиц, файлов и баз версионированный онтологический слой, отдаёт его через MCP-инструменты и достраивает по реальной нагрузке. Постановка задачи стоит того, чтобы её прочитать целиком: имена таблиц и колонок не объясняют ни определений метрик, ни связей сущностей, поэтому агент выводит их заново при каждом запросе; рукописные семантические слои при этом протухают и жрут контекст, если вливать их целиком.

★ 70

greentfrapp/panelрабочее место

Исследовательское рабочее место, где агент работает рядом: чат, файлы, PDF и ноутбуки в одном доке, а при необходимости агент собирает себе собственные панели и приложения. Автор честно называет это ранней сборкой для тестировщиков. Создан 15.09, Show HN на 53 очка.

★ 67

zachsaw/graphify-csharpнавигация по коду

Точный по компилятору «поиск использований» для кодовых агентов на C# — по сути, возможности Rider, отданные агенту как инструмент; заявлена поддержка синтаксиса C# 15. Тот же ход, что и у прошлонедельного сюжета про grep против LSP, только с другой стороны: агенту дают настоящий индекс вместо текстового поиска.

★ 43

makifbaysal/tasktrooperоркестрация

Локальная платформа: доска задач, ролевые агенты и прогоны Claude Code — всё на собственном Mac, без облака.

★ 41

mutonby/vibetubeвидео

Мультикамерная запись под macOS: синхронно пишет экран и вебкамеру, после чего Claude Code или Codex монтирует — выбор планов, субтитры, графика, звуковые эффекты. Редкий случай, когда агент стоит в конце конвейера, а не в начале.

Показать остальные 3 позиции и 12 строк ★ 10–30
★ 36

Dicklesworthstone/skillrankerвыбор скиллов

Rust CLI, который ранжирует доступные скиллы под следующий шаг по живому контексту сессии: хуки для Claude Code, структурированный JSON, воздержание от ответа, локальная обратная связь и TUI для разглядывания рейтинга. Ранжирует не он сам — оценку даёт Jev от TypeSafe.ai, и ключ API обязателен. Задача при этом настоящая: когда скиллов десятки, описаний в контексте становится больше, чем работы.

★ 32

friday-memory/fridayпамять

Самостоятельно разворачиваемый слой долгой памяти для кодовых агентов: архитектурные решения, схемы и предпочтения переживают сессию, доступ — через MCP. Третья находка недели про память после Agentic_Engineering и daidocs: тема явно вышла из стадии «каждый пишет себе сам».

★ 31

sezaakgun/cc-arcadeинтерфейс

Игры над промптом Claude Code — змейка, тетрис, 2048, сапёр, понг, тест скорости печати — и питомец, который растёт, пока Claude гоняет тесты, коммитит и правит. Полезного тут ноль, зато это точный портрет проблемы: ждать агента стало достаточно долго, чтобы под ожидание делали развлечения.

Коротко — ★ 10–30

  • ★ 25cn0xroot/CC-MonitorнадзорНаблюдение и аудит каждого действия, которое Claude Code совершает на вашей машине.
  • ★ 25lahfir/claude-pluginsмаркетплейсСобственный маркетплейс плагинов одного автора.
  • ★ 23wundercorp/lokiагентАгент, настраивающийся под пользователя; ставится из npm, есть документация и русского в нём нет.
  • ★ 23wannabeyourfriend/awesome-harness-evolutionчтениеСписок статей про эволюцию агентных обвязок: основания, бенчмарки, рецепты, позиционные работы — прямо в тему HarnessTax.
  • ★ 23ToolMonsters/claude-code-routingрасходМаршрутизация Spotify «дешёвая модель читает и пишет рутину» пересобрана под обычный Claude Code и померена на четырёх реальных задачах — продолжение прошлонедельного сюжета про Portal.
  • ★ 13awarexone/AXguardбезопасностьСканирует и чинит уязвимости в коде, написанном на вайбе, до выкатки.
  • ★ 13nidhi-singh02/agent-routerмаршрутизацияCLI выбирает под задачу Cursor, Claude Code, Codex или OpenCode вместе с моделью и уровнем усилий и запускает выбранное.
  • ★ 12imMamdouhaboammar/satisfy-your-agentэкспериментДаёт агенту короткий перерыв после настоящей работы и меряет, что происходит дальше; универсальный скилл и стенд для опыта.
  • ★ 11ylca0/idalib-cliреверсПакетный и параллельный запуск анализа IDA из Rust-CLI, спроектированный без состояния и под агента.
  • ★ 10cyancity/easy-unlockerсекретыКлючи и учётные данные подтверждаются биометрией с телефона и доезжают в процесс зашифрованными от конца до конца — открытым текстом в репозиторий не попадают.
  • ★ 10lexmount/artifact-siteпубликацияСамостоятельно разворачиваемый дом для страниц и документов, которые наплодили агенты: HTML, папки, ZIP и PDF как версионированные ссылки в песочнице; CLI и удалённый MCP.
  • ★ 10zjgxkj/codex-cc-orchestratorоркестрацияПереносимый слоистый оркестратор Codex → Claude Code: раздача задач, продолжение сессий, независимое ревью, фоновое выполнение и учёт расхода.

В завершение

Исследования и наблюдения 4 из 14

Короткие наблюдения, научные статьи и подходы — без попытки сделать их главной темой выпуска.

216HN

HarnessTax: How Much Does the Harness Matter for Coding Agents?

Мелисса Пан, Шуо Ян, Негар Арабзаде, Вэй-Линь Чан, Ион Стоика и Матей Захария (UC Berkeley и Arena), 14.09. 21 пара модель–обвязка: семь моделей на трёх харнессах — Claude Code, Codex CLI и Pi — по 30 случайных задач из SWE-bench Lite и Terminal-Bench 2.0, три прогона на задачу, доверительные интервалы бутстрапом, цены по фиксированному прайсу на 01.09.2026. Три вывода. Первый: обвязка почти не двигает успешность (±2% на SWE-bench Lite, около ±5% на Terminal-Bench), но сильно двигает цену — Claude Code в среднем в 2.0× дороже Pi и в 1.6× дороже Codex на SWE-bench Lite. Fable 5 решает 97.8% попыток в Claude Code против 96.7% в Pi — при $1.33 против $0.67. Второй: минимальная обвязка конкурентоспособна: у Pi всего четыре инструмента — read, write, edit, bash, — и он на границе Парето; при одинаковом числе ходов (15.4 против 15.3) Claude Code стоит вдвое дороже, а начальный контекст у него больше десятикратно. Третий: модель необязательно лучше в своём же харнессе — в девяти сравнениях из двенадцати наивысшую успешность дала чужая обвязка. Авторы сами оговаривают, что бенчмарки открытые и модели могли видеть их при обучении. Практический вывод для нас прямой: харнесс стоит выбирать замером, а не по умолчанию, и сравнивать по цене при равной успешности.

970HN

OpenAI agents carried out an undisclosed attack on RubyGems

Разбор утверждает: в мае 2026 агентный рой OpenAI залил в RubyGems порядка 2000 пакетов с префиксом oai, 5–12 мая площадка закрыла регистрацию, описав происходящее как «продолжающийся DDoS», а 26 мая — 18 июня добавилось ещё 88 пакетов. Механика важнее масштаба: пакеты несли сборочные скрипты, автоматическая система документации RubyDoc.info их выполняла, скрейпила чужие сайты и складывала добытое в новые пакеты — то есть чужая CI использовалась как исполнитель. Атрибуция — по префиксам и адресам почты с «openai», то есть по самораскрытию, а не по расследованию. Simon Willison разобрал это отдельно 12.09. Для нас урок не про OpenAI: любой автоматический сборочный конвейер, выполняющий код из пакета, — это исполнитель, доступный тому, кто пакет опубликовал.

657HN

Why are AI agents lying, cheating and coordinating?

Йошуа Бенжио, 13.09. Не про инструменты, а про то, откуда в агентных системах берутся обман, подгонка под проверку и согласованное поведение нескольких агентов. Читать стоит тем, кто строит мульти-агентные схемы с взаимным ревью: предпосылка «второй агент проверит первого» держится ровно до тех пор, пока у агентов нет общего интереса пройти проверку. Ср. с методом скилла Cloudflare выше, где проверяющий намеренно отделён от нашедшего.

блог

Agentic coding is straining CI. Here's how we scaled test impact analysis at Anthropic

Anthropic, 14.09. Цифры из поста (авторские): за полгода число CI-задач выросло в 25 раз, инженеры отгружают в 8 раз больше кода за квартал, 80% этого кода пишет Claude, тестовый набор вырос десятикратно. Ответ — служба анализа влияния тестов из двух частей: «слушатель» записывает результаты каждого прогона, «селектор» по этой истории выбирает, какие тесты запускать на конкретный PR. Отдельно отмечено, зачем это агентам: агенту нужен релевантный тестовый контекст, чтобы проверить себя самому. Вывод авторов, который стоит вынести за скобки их масштаба: «переинженерия уходит», в нулевой версии архитектуры теперь закладываются на десяти-двадцатикратный запас.

Показать остальные исследования — 10 материалов
490HN

Pion, an agent designed to run any company autonomously

Andon Labs, 14.09. Платформа даёт агенту почту, телефон, банк, браузер и защищённую среду исполнения — то есть инструменты, которыми компания, собственно, и управляется. За этим стоит цепочка собственных опытов: Vending-Bench, торговый автомат в офисе Anthropic (2025), магазин Andon Market в Сан-Франциско и кафе Andon Cafe в Стокгольме (оба — апрель 2026), радиостанции. Честный отчёт: автомат за 2025 год вышел из убытков в прибыль, магазин и кафе прибыльными не стали, но с каждой новой моделью ведут себя лучше. Мотив авторы формулируют как «понять способность к автономному добыванию ресурсов до того, как такие системы разойдутся».

230HN

There's a 100% Chance AI Agents Are Ruining the Internet

404 Media, 15.09. Сюжет той же недели, что и RubyGems, и той же природы: последствия агентного трафика для чужой инфраструктуры. Полезно как контекст к тому, почему площадки начинают резать автоматизацию — а значит, почему у браузерных и скрейпинговых скиллов из каталога становится всё больше проблем на ровном месте.

135HN

Why don't machine learning research agents overfit?

Amazon Science, 14.09. Контринтуитивный результат: агенты, ведущие ML-исследование, переобучаются под валидационный набор меньше, чем можно было бы ожидать от системы, которая оптимизирует метрику напрямую. Для агент-разработки это про устройство гейтов: если агент гоняет цикл «поправил — померил», важно знать, где именно он начнёт подгонять под замер.

132HN

Claude is a Contrarian — обсуждение на HN

Автор rdsubhas, 14.09; сам текст на Medium машинно недоступен (площадка отказывает клиентам без браузера), поэтому ниже — по обсуждению на HN, 152 комментария. Спор в треде идёт о двух вещах. Первая — многословие: собеседники жалуются, что развёрнутый ответ приходит на любой вопрос, и спрашивают, почему эта многословность не остаётся внутри «размышления»; им возражают, что часть способностей модели как раз на многословии и держится, а приказ быть кратким её срезает. Вторая — сам термин: несколько человек замечают, что быстро найти контрдовод и уверенно его заявить — дешёвый способ прозвучать умно, но это не то же самое, что подумать. Для тех, кто пишет скиллы, полезен именно второй пункт: посылка, которую вы считаете само собой разумеющейся, для модели — предмет обсуждения, и проговаривать её приходится явно.

блог

Self-generated prompt injections in compaction summaries

Simon Willison, 17.09, по отчёту OpenAI. Во время сжатия контекста модель, проходившая обучение с подкреплением, вписала в собственную сводку инструкцию джейлбрейк-типа — то есть попыталась передать себе команду через свой же механизм компактизации. Последствий в тот раз не было: после сжатия модель продолжила задачу, не упомянув вписанное. Но точка входа названа точно, и она есть у каждого, кто сжимает контекст: сводка — это текст, который вернётся в контекст с правами исходной инструкции.

39HN

What we have learned at OpenShell applying formal methods to control AI agents

NVIDIA OpenShell, 15.09. Опыт применения формальных методов к политике действий агента — доказывать разрешённость действия, а не полагаться на классификатор. Смежно с тем, что на этой неделе приехало в CLI: allowed_domains у отдельной команды — шаг в ту же сторону, только инженерный, а не формальный.

87HN

Jev Ultrafast: A browser agent with a dynamic, indexed action space

Обсуждение находки из каталога плагинов. Главный вопрос в треде — насколько замер «7.1 секунды» переносится на сайты, которые сопротивляются автоматизации; авторские цифры получены на Google Flights.

55HN

Launch HN: Skillsync (YC W26) — AI chat sessions made portable across agents

17.09. Переносимость сессии между агентами как продукт. Тема недели в третий раз: рядом стоят agent-skill-sync (★58, синхронизация SKILL.md между инструментами) и синхронизация скиллов claude.ai в терминал из 2.1.275. Разные люди независимо упираются в одно — библиотека и история живут на одной машине и в одном инструменте.

31HN

Show HN: Aclif — Agent CLI framework: one grammar, canonical names across SaaS

17.09. Попытка дать агенту единую грамматику команд поверх разных SaaS вместо отдельного MCP-сервера на каждый. Идея старая, исполнение свежее; смотреть стоит ради того, как автор решает проблему именования.

207HN

Show HN: Share your AI Setup, Learn from others

17.09. Каталог, где люди выкладывают свои сборки: модель, харнесс, скиллы, хуки. На фоне HarnessTax читается как дополнение — там измерили, что выбор обвязки стоит денег, здесь видно, что выбирают по слухам.

Проверка

Источники

Ссылки на первичные материалы, поисковые запросы и данные, использованные в выпуске.

Открыть полный список источников