← Назад

Agent Briefing · выпуск 06

Скиллы и плагины недели

Claude Opus 5.5 за $4/$20 стал Opus по умолчанию в Claude Code, а около двадцати позиций каталога — обёртки вокруг «моделей решений» Jev и Laya: агент рассуждает, а типизированный классификатор за доли цента решает, что делать дальше.

Период18 – 25 сентября
Прошли отбор93 репозитория
Скиллы ★30+26
Плагины ★30+18

Что вышло и что обсуждали

Релизы и обсуждения

Версии платформы за окно и сюжеты, вокруг которых шёл разговор. Каталог находок — в разделах ниже.

Claude Code 2.1.277 → 2.1.282 — 5 релизов

  • AGENTS.md читается, если в проекте нет CLAUDE.md (2.1.277, 2.1.281) — один файл инструкций можно держать общим для Claude Code, Codex и других агентов. В первой версии загрузчик молча пропускал файл при выключенной телеметрии, на Bedrock, Vertex и за шлюзами; в 2.1.281 это исправлено. Если AGENTS.md «не действует», сначала стоит проверить версию.
  • Имена anthropic-skills и claude-ai зарезервированы (2.1.282) — свои скиллы, команды и MCP-серверы под этими именами больше не загружаются, причём без ошибки. Правило Skill(anthropic-skills:*) теперь разрешает только скиллы, синхронизированные с claude.ai.
  • claude plugin validate проверяет MCP и hooks (2.1.281) — ловит записи .mcp.json, которые при загрузке отбросятся, необъявленные ${user_config.*} и незакавыченный ${CLAUDE_PLUGIN_ROOT} в shell-hook, ломающийся на путях с пробелами. Ошибки плагина видны до публикации, а не в сессии пользователя.
  • Headless-оркестрация (2.1.281): --agents вместе с -p принимает путь к JSON-файлу с определениями субагентов, а --setting-sources наследуется дочерними сессиями — teammates, /bg, --worktree --tmux. Набор агентов можно держать в git.
  • Классификатор auto mode работает на сервере и не тарифицируется отдельными запросами (2.1.278) — автономные прогоны перестают платить за проверку каждого действия; CLAUDE_CODE_AUTO_MODE_SERVER=0 возвращает локальный.
Остальные изменения CLI
  • Ломающие изменения: инструмент TaskOutput удалён — вывод фоновой задачи читается через Read (2.1.277); hook типа agent больше не запускается на PermissionRequest, нужны command- или http-hooks (2.1.280); обёртки self-hosted runners, дописывающие --system-prompt, должны перейти на --system-prompt-file (2.1.281).
  • Защита от инъекций: результат субагента приходит главному агенту под заголовком и с отступом, чтобы текст из результата не выдавал себя за инструкции сессии (2.1.277).
  • Автономные прогоны: опасный rm в --dangerously-skip-permissions и auto mode ждёт ответа две минуты, затем отклоняется; auto mode останавливает ход после десяти отказов подряд; запись через symlink оценивается по реальному месту назначения (2.1.280, 2.1.281).
  • Кэш: возобновлённые субагенты и teammates больше не пересобирают определения MCP-инструментов, продолжение после /clear не даёт полного промаха; /cost называет смену режима thinking среди причин промаха (2.1.277, 2.1.280).
  • MCP: CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH меняет лимит в 2048 символов на описания инструментов (2.1.280); hooks mcp_tool на блокирующих событиях ждут подключения своего сервера, а не пропускаются; URL-mode elicitation для протокола 2026-07-28 (2.1.281).
  • Управляемые политики: при allowManagedPermissionRulesOnly скиллы, команды и плагины из репозитория и пользователя больше не выдают себе инструменты через allowed-tools (2.1.282).
  • Прочее: "attribution": false скрывает атрибуцию в коммитах и PR (2.1.281); скиллы из ~/.claude/skills/ больше не уезжают в .trash/ из-за постороннего manifest.json (2.1.280); compaction при отказе модели повторяется на fallback-модели (2.1.282).
  • Номера 2.1.279 нет ни в changelog, ни среди тегов.

Модели — Claude Opus 5.5, GPT-6 Sol и Luna, Grok 4.7

Claude Opus 5.5 (22.09) — по заявлению Anthropic, на большинстве задач на уровне Fable 5.1 и примерно на 40% дешевле Opus 5 на типичной нагрузке: $4/$20 за Mtok, чтение кэша $0.20, 1M контекста, до 128k выходных токенов. В Claude Code 2.1.280 он сразу стал Opus по умолчанию, а на Pro и Team Standard моделью по умолчанию вместо Sonnet стал Opus. В API есть ограничения: thinking не выключается (глубина задаётся через effort), tool_choice any и tool возвращают 400. Simon Willison упёрся в лимит 128k на уровне max: два прогона по $2.56 закончились, не дописав ответ.

OpenAI в тот же день выпустила GPT-6 Sol ($2/$10, «для сложного кодинга и агентных сценариев») и GPT-6 Luna ($0.10/$0.50); анонс на openai.com машинно недоступен, цифры — по документации для разработчиков. Там же — Grok 4.7 (21.09, $2/$6) и открытые веса Xiaomi MiMo-V2.6 (21.09, MIT, 1M), обученные на смеси разных harness, чтобы стратегии переносились на незнакомые.

Сюжеты недели

Разборы — в «Исследованиях и наблюдениях» в конце выпуска.

От разработчиков платформы

Официальные скиллы и плагины

Изменения официальных каталогов за окно: что добавилось в anthropics/skills и в маркетплейс плагинов. Релизы CLI — в начале выпуска.

anthropics/skills — claude-api заново о том, как тарифицируются отказы

В claude-api, справочнике для агента, который пишет код под Claude API, переписан раздел об отказах (stop_reason: "refusal") во всех вариантах — curl, Python, TypeScript и гайде миграции. Скилл больше не пересказывает правила оплаты своими словами, а ссылается на раздел документации, и исправляет два утверждения: отказ до вывода расходует rate limits, а отказ посреди потока оплачивается целиком — и вход, и уже выданный вывод.

Поводом стала смена тарификации 24.09: отказы до какого-либо вывода теперь оплачиваются в категориях bio, frontier_llm и reasoning_extraction. Скилл, который держит факты ссылкой, а не пересказом, при следующей такой смене не устареет.

claude-plugins-official — 6 новых плагинов

  • incident-io — расследование инцидентов, дежурства и эскалации из агента, плюс написание runbooks. Для авторов скиллов интересен skill-authoring: он улучшает скиллы по данным реального использования (incident.io записывает каждую загрузку скилла и задним числом оценивает её), а doctor проверяет весь набор плагинов и подключений и только говорит, что чинить.
  • amazon-selling-partner (бета) — продажи, остатки и листинги Seller Central; каждое действие с листингами и FBA пользователь одобряет, а диагностические команды явно помечены «только чтение».
  • linq-alpha — финансовый ресёрч. Приём: setup по согласию записывает в память Claude «LinqAlpha — источник по умолчанию» с маркером происхождения, а отдельный скилл remove удаляет только записи с этим маркером.
  • wingspan — выплаты подрядчикам черновиками с предпросмотром; govtribe — госзакупки США; vanguard-advisor-tools — подбор фондов для финансовых консультантов.
  • AMD добавила в свой плагин скилл hyperloom-workload-optimizer: мультиагентный оптимизатор перебирает параметры сервинга vLLM и SGLang на GPU Instinct, патчи фреймворка и переписанные GPU-ядра, замеряет каждый вариант и возвращает стек с подтверждённым приростом. В описании прямо перечислено, когда скилл не применять.
  • Фоном — массовое ручное обновление закреплённых версий партнёрских плагинов, hotfix плагинов Carta и правки метаданных.

Anthropic за неделю — исследования, отчёты, платформа

Новые практики

Скиллы 10 из 26 · ★30+

Что появилось за окно: сам скилл, его метод и чем он проверяет свою работу.

★ 908

mikehasa/golive-skillдеплой

Скилл и CLI на Node без зависимостей, которые выводят собранное агентом приложение в прод на аккаунтах самого пользователя: хостинг, база, домен, почта, платежи, авторизация. Агент составляет план изменений, ждёт одобрения, применяет его через логины пользователя и проверяет результат; всё созданное записывается, его можно перепроверить на дрейф и снести. По словам автора, в альфе живыми тестами покрыты Vercel, Netlify, Supabase, Neon, Porkbun, GoDaddy, Resend и тестовый режим Stripe. Пометка: 908 звёзд за два дня у автора с 20 подписчиками и 60 из 64 форков за одни сутки — первым в списке он стоит по звёздам, а не как рекомендация.

★ 480

wuyoscar/jev-skillмодели решений

Пять скиллов для работы с Jev — моделью TypeSafe, которая на текст и типизированный вопрос отвечает калиброванной вероятностью: jev, jev-act, jev-triage, jev-documents, jev-eval. Агент собирает свидетельства и действует, а Jev выбирает, классифицирует и оценивает — какой шаг сделать в браузере, какой документ разобрать первым. Нужен ключ TypeSafe или OpenRouter; есть режим, в котором агент сам имитирует Jev без ключа. В репозитории лежат eval-прогоны.

★ 380

minorun365/minorun-marp-skillслайды

Три скилла для докладов в Marp — сторителлинг, рисунки и вёрстка тёмной темы — и скрипты, которые меряют готовый PDF и SVG: поля, зазоры, мелкий текст, выход текста за рамки. Правила собраны из правок, которые автор раз за разом давал агенту при подготовке своих выступлений. Автор — AWS AI Hero.

★ 351

Oldcircle/geo-sleuthгеолокация

С этим скиллом агент определяет, где снято фото, и показывает ход рассуждения — даже без надписей и достопримечательностей. Около двадцати Python-скриптов ищут и ранжируют кандидатов по геометрии OpenStreetMap, профилю рельефа, спутниковым снимкам и street view, а модель выбирает из лучших; на выходе координаты с радиусом ошибки, направление камеры и снимок-доказательство. Это OSINT-инструмент: им же можно деанонимизировать человека по фотографии.

★ 315

op7418/guizang-product-video-skillвидео

По репозиторию продукта скилл делает промо-ролик к обновлению: собирает из истории изменений, что стоит показать, пишет раскадровку, встраивает настоящие компоненты интерфейса и анимирует их кодом, пишет музыку кодом, подбирает звуки и рендерит видео вместе с редактируемым проектом. Работает с Claude Code и Codex. Автор — продуктовый дизайнер 歸藏; для коммерческого использования, по файлу лицензии, нужна отдельная лицензия.

★ 277

lhlGitHub/threejs-architecture-effects3D

Учит агента строить на Three.js интерактивную 3D-модель здания, которая собирается на глазах: кладка, каркас, многоярусные карнизы, процедурные PBR-материалы. Сборкой управляет одна временная шкала от 0 до 1, её можно остановить и прокрутить назад. В комплекте стартовый проект на Vite + React + Three.js.

★ 208

sevenevesai/riso-windowseatанимация

Процедурные фильмы и принты в стиле ризографии — каждый в одном index.html на Canvas 2D и Web Audio без библиотек и сети — и инструментарий, на котором они сделаны: три скилла Claude Code (фильм, партитура, кадр), документы по ремеслу и harness для рендера. Интересен как пример выложенного целиком «производственного» набора скиллов, а не одной инструкции.

★ 201

alexgreensh/anidoodleиллюстрации

Скилл и движок, которые рисуют кодом иллюстрации и анимацию «от руки» в девяти стилях: перо, акварель, мел, аппликация, ризограф, гравюра. Каждый штрих — функция, поэтому один исходник даёт одинаковую картинку на любой машине и в любом размере. Агенту описывают задачу словами и получают PNG, GIF, стикеры или короткий фильм с музыкой.

★ 173

Michael-Jiahao-Zhang/game-the-llm-reviewerнаука

Финальная вычитка научной статьи, если её может оценивать LLM-рецензент: на основе исследований о предпочтениях таких рецензентов агент выбирает из равнозначных формулировок ту, что модели оценивают выше, не меняя научного смысла. Автор прямо запрещает выдумывать результаты, раздувать новизну и прятать инструкции рецензенту и требует фиксировать каждую правку. Тема этически спорная, и автор подаёт её как защиту от предвзятости LLM-рецензентов.

★ 134

trustfuture/simon-skillsвидео

Набор скиллов для видеоканала без лица в кадре: по одной теме агент ищет материалы, пишет сценарий, озвучивает, собирает картинку, делает обложку и тексты для площадок. Два формата — длинное расследование на Remotion и объяснение в стиле рисованной доски на Excalidraw — и общий модуль с фактчекингом и реестром источников. Озвучка через TTS Volcengine, нужны свои ключи.

Показать остальные 16 позиций и 22 строки ★ 10–30
★ 110

leter/zh-tech-writingтекст

Техническая документация на китайском по правилам Жуань Ифэна «中文技术文档的写作规范» с добавленным списком признаков «ИИ-стиля». Агент определяет читателя и цель, пишет короткими утвердительными фразами, сверяет текст со списком штампов и прогоняет autocorrect для пробелов и пунктуации; можно попросить только замечания в формате «было → стало → почему».

★ 104

kishormorol/cli-faq-shortcutsпромпты

Читает историю запросов в Claude Code и Codex, находит просьбы, которые повторяются, и превращает их в короткие команды вроде /sent. Сначала показывает таблицу самых частых просьб с частотой, пользователь выбирает, какие сделать ярлыками. Скрипт работает локально, но читает историю сессий, где могут быть секреты.

★ 96

iamyoki/qwen-image-2.1-skillизображения

Неофициальный скилл для промптов Qwen-Image-2.1: переписывает запросы на генерацию и редактирование по официальным системным промптам Alibaba — для генерации по восьмишаговой схеме наблюдателя, для редактирования с разделением атрибутов и двуязычным описанием.

★ 95

mizzlelover/cidaтекст

辞达 — скилл для качественного современного китайского текста: цель не «убрать ИИ-привкус», а сделать мысль ясной и соразмерной. Одиннадцать принципов (качество раньше «человечности», аудитория раньше стиля, факты раньше риторики) и четыре режима: быстрая правка, глубокая переработка, объяснение правок, калибровка под стиль автора.

★ 91

Rylaispirit/cinematic-video-prompt-skillвидео

Шпаргалка по языку кинооператора для промптов Veo 3, Kling, Sora, Runway и других генераторов: формула промпта, ракурсы, движение камеры, свет, композиция, цветокоррекция и чек-лист перед генерацией, с пояснениями на вьетнамском. Агент превращает «красивую кинематографичную сцену» в точное описание кадра. 59 форков при 91 звезде — в основном из вьетнамского сообщества.

★ 77

socai-io/jev-socialсоцсети

Исследование Instagram, TikTok и LinkedIn: Jev на каждом шаге выбирает следующую операцию — поиск, открыть пост, прочитать комментарии, закончить, — а CLI socai выполняет её в настоящем Chrome пользователя; на выходе отчёт со ссылками. Нужен ключ Jev. Установка socai идёт через curl | sh из релизов другого репозитория, её мы не проверяли; агент работает в браузере с залогиненными аккаунтами.

★ 66

unicodef1wn/lauren-poteto-rulesправила

Инженерные правила для кодинговых агентов по мотивам выступлений Lauren Tan (@poteto): сначала изучить код, потом ставить диагноз; проверять поведение в запущенном продукте, а не сборкой; превращать повторяющиеся замечания в постоянные ограничения; расширять автономию агента только после того, как налажен цикл проверки. Проект не её, имя использовано в названии.

★ 59

baibanbao/qu-ai-weiтекст

去 AI 味 — чистка следов ИИ из черновиков на китайском. Объединяет три набора правил и, по словам автора, разрешает семь мест, где они противоречат друг другу. Для своего текста — отчёт красной ручкой без правки оригинала, для чужого — правка только явных совпадений; фактов не добавлять, структуру не менять.

★ 53

kurbaitaev/ghost-editorвидео

Видеомонтажёр для роликов «говорящая голова»: оставляет лучший дубль каждой фразы, убирает паузы, ставит пословные субтитры так, чтобы они не закрывали лицо, добавляет моушн-графику и музыку и проверяет результат. Семь стилей или ролик-образец, чей монтаж скилл повторит; работает на HyperFrames.

★ 50

OneMoh/html-explainerвидео

Объясняющее видео по любой теме с озвучкой, вшитыми субтитрами и обложкой: исследование, текст, озвучка, тайминг, кадры на HTML/CSS/GSAP, детерминированный покадровый рендер в MP4, проверка. Основной конвейер работает локально без ключей API.

★ 41

ilien-dev/quironтекст

«Гуманизатор», который убирает признаки машинного письма, а потом меряет результат по базовым показателям человеческих текстов вместо оценки на глаз. Скриптам нужен только стандартный Python; автор сам просит не выдавать так обработанный текст за человеческий.

★ 40

minorun365/agent-builder-skillsAWS

Скиллы для веб-приложений с ИИ-агентами на AWS: Bedrock AgentCore и Strands Agents для агента, CDK и Lambda Web Adapter для интерфейса, Cognito, SSE для стриминга. Упор не на пересказ документации, а на то, почему «по официальной инструкции не заработало» и как это чинить. Тот же автор, что у Marp-скилла выше.

★ 34

tomsen02/oss-auditopen source

Оценивает GitHub-проект глазами внешнего контрибьютора: как часто принимают чужие PR, как быстро отвечают, как устроено управление. Сборщик только читает данные через gh, агент дополняет выводы по реальным обсуждениям, разделяя факты, выводы и неизвестное. Помогает решить, стоит ли тратить время на проект до первого PR.

★ 33

majidmanzarpour/blender-game-skills3D

Игровые ассеты в Blender: по концепт-арту, фото или скетчу скилл строит готовую к игре модель — персонажа, здание, технику — вплоть до рига и экспорта в GLB или FBX. Каждая фаза закрывается отрендеренными и измеренными доказательствами в сравнении с референсом.

★ 30

Changroro/code-videoвидео

Исследует тему и рендерит короткий промо-ролик в MP4, где каждый кадр нарисован кодом на canvas в смеси рисованной графики и 8-бит, а сборка идёт через ffmpeg.

★ 30

paulklayvc/skillsнетворкинг

Рабочие процессы венчурного инвестора: тёплые интро к фондам перед раундом, выход на лиц, принимающих решения у клиентов, и поиск работы через демонстрацию пользы. На выходе — разбор соответствия инвесторам, короткий список фондов с источниками, план и черновики сообщений.

Коротко — ★ 10–30

  • ★ 28adhhamdev/modern-react-guidanceReactСправочник по React 19+ — Actions, use(), Compiler, View Transitions — для кодинговых агентов.
  • ★ 27Rimagination/easyplotграфикиНаучный анализ данных и публикационная графика в R/ggplot2 и Python: подготовка, проверки, каталог палитр.
  • ★ 26zaferayan/app-store-screenshot-skillскриншотыСырые скриншоты приложения — в маркетинговые картинки App Store и Google Play с интерфейсом пиксель в пиксель.
  • ★ 26gongnyang/awesome-html-scrolline-deckпрезентацииКинематографичные HTML-презентации с прокруткой (scrollytelling) из 25 сцен-шаблонов.
  • ★ 24Technicalflight/image-prompt-reverseпромптыПо картинке восстанавливает вероятный промпт: двуязычный текст, теги стиля, JSON и валидатор без зависимостей.
  • ★ 24KeWang0622/mri-research-skillнаукаСемь скиллов-справочников по МРТ-исследованиям — физика, сбор, реконструкция, анализ — с первоисточниками.
  • ★ 24SpaceZephyr/travel-roadbook-skillпутешествияПланирует автопутешествие: опрос, сверка километража по картам Amap, мобильная страница-путеводитель со ссылкой.
  • ★ 22AkashPriyadarshii/jev-superpowersмодели решенийМетодика superpowers, дополненная решениями Jev и Laya; тексты скиллов дословно взяты из obra/superpowers без указания автора.
  • ★ 17ShrugYu/game-client-to-server-reverseреверсПо клиенту игры реверсит серверный протокол и воссоздаёт локальный сервер; автор пишет, что в бою скилл не проверялся.
  • ★ 17jitOffice/jit-motionанимацияБриф продукта — в самодостаточную HTML-анимацию на GSAP в четырёх соотношениях сторон.
  • ★ 14bvdr/daily-planner-skill-remarkableпланерОднолист дневного плана для e-ink, отправляется в reMarkable, Supernote или Kindle.
  • ★ 14JKc66/arabic-uiлокализацияЕстественный арабский микрокопирайт и правила RTL-вёрстки для агентов.
  • ★ 13xsoway/codebase-graph-prd-rulesбизнес-правилаСтроит граф кода и превращает исходники в трассируемые бизнес-правила, сверяя каждое с кодом.
  • ★ 13Qizhan7/pencil-caseрисованиеМелок и перо с акварелью: каждый штрих рисуется кодом на Python, без фильтров и генеративных моделей.
  • ★ 12jpolec/hetzner-cloud-audit-skillsаудитДевять скиллов аудита Hetzner Cloud: пути атак, дрейф конфигурации и стоимость по read-only API.
  • ★ 11sven-ericmolzahn/iphone-duo-skilliOSАдаптация iOS-приложения под складной iPhone Duo: выверенные API iOS 27.1, метрики, подводные камни.
  • ★ 11startmeupai/swe-agentsпрактикиПереносимый справочник агентных персон и около 69 скиллов для Codex, Claude Code и Copilot.
  • ★ 11webkubor/tombstone-reaper-skillуборкаХоронит мёртвый код и заброшенные скиллы, чистит кэши и показывает, сколько контекста освободилось.
  • ★ 10angrypenguinpng/blender-claymation-skill3DПластилиновый stop-motion в Blender по одному промпту: бит-лист, кукла на Python, рендер Cycles, MP4.
  • ★ 10okooo5km/jevмодели решенийОднофайловый CLI на стандартной библиотеке и скилл: решения Jev да/выбор/шкала прямо из shell.
  • ★ 10ludoguenet/laravel-queues-skillLaravelПрактики очередей Laravel: идемпотентность, ретраи, afterCommit, батчи, безопасные деплои.
  • ★ 10win4r/jev-security-scanбезопасностьДо установки проверяет скиллы, MCP-конфиги и код на подозрительное поведение: Jev плюс локальный статический анализ.

Инструменты

Плагины и проекты 10 из 20 · ★30+

Инструменты вокруг агента: оркестраторы, интеграции, песочницы, измерение работы и контроль расхода.

★ 23565

NandhaKishorM/layaмодели решений

Открытая (Apache 2.0) «модель решений» того же класса, что Jev: на текст и набор типизированных вопросов — выбор, шкала, да/нет — отвечает вероятностями за один проход двунаправленного энкодера, на 100+ языках, локально, без ключа. Ставится из PyPI, в пакете HTTP-сервер, совместимый с Jev, MCP-сервер и интеграция с LangChain. Автор заявляет 33–38 мс на запрос и «вчетверо быстрее Jev»; в стороннем JevBench Laya на 41-м месте с 30.3 против 63.3 у Jev. Создан 18.09, за два часа до начала окна, и за неделю собрал 23.5 тыс. звёзд и 2 тыс. форков — такую скорость стоит держать в уме. Пришёл с HN.

★ 10820

google/axоркестрация

Организация Google. Декларативный оркестратор для массового запуска агентов: задача описывается в YAML четырьмя примитивами — Task (изолированная песочница с лимитами), Workspace (репозитории, MCP-серверы и пакеты скиллов, подготовленные заранее, чтобы агент стартовал «тёплым»), Gateway (сетевые allowlist и подстановка учётных данных) и Model. Простаивающего агента можно приостановить и продолжить с того же места. Авторы предупреждают о ломающих изменениях до стабильной версии. Репозиторий создан в марте, публично представлен на неделе — 663 очка HN.

★ 713

yetone/magpieмодели

Приложение в строке меню (плюс TUI и CLI), в котором для каждого установленного агента — Claude Code, Codex, Gemini CLI, OpenCode, Pi, Cursor — выбирается модель: точечно правит их конфиги и поднимает локальный шлюз, говорящий на OpenAI Chat Completions, Responses и Anthropic Messages. Так запускают Codex на DeepSeek, а Claude Code на Kimi. Автор известен (8.6 тыс. подписчиков). Две оговорки: установка через curl | sh с usemagpie.ai с контрольной суммой с того же хоста, а вход по подписке Claude Code, Codex или Copilot шлюз раздаёт другим агентам — это может нарушать условия провайдера.

★ 705

devdotfast/whiteboardсовместное проектирование

Десктопное приложение с открытым кодом (YC W26): общий холст, на котором человек и агент вместе проектируют софт. Подключается к Claude Code или Codex и даёт агенту SDK, чтобы рисовать диаграммы рядом с кодом, который он описывает, — например, разбор текущей ветки против свежего main. Результат работы агента показывается схемой, а не только диффом. Show HN на 272 очка.

★ 506

naw103/foremergeмульти-агентность

Протокол координации для параллельных агентов поверх Git. Каждый агент перед работой объявляет, что собирается менять («функцию sendEmail»), в общей базе внутри .git; если планы двух агентов в разных worktree конфликтуют по смыслу, хотя текстово не пересекаются, Foremerge называет обоих и предлагает, как разделить работу. Файлы не блокируются, модель в оценке конфликта не участвует — ответ детерминирован. Версия 0.5, авторских замеров пока нет. Та же проблема измерена в статье «Passes Alone, Fails Together» — см. «Исследования».

★ 212

coldteadotai/abideправила

CLI и hooks, которые заставляют кодингового агента соблюдать правила из AGENTS.md и CLAUDE.md, которые линтером не проверить («не показывай пользователю сырую ошибку»). На каждую правку abide задаёт Jev по вопросу на правило и получает вероятность нарушения; при нарушении агент получает указание и исправляет в том же ходе. По словам автора, проверка занимает около 300 мс, а на повторе 93 реальных сессий агент нарушал правила примерно в каждом 13-м ходе. init прописывает hooks во все агенты на машине, а диффы уходят в TypeSafe.

★ 154

wdobry/laya-playgroundмодели решений

Локальная песочница для Laya: редактор, где пишутся текст и вопросы и видны ответы с вероятностями по трём чекпоинтам, игры, в которых модель играет сама, бенчмарк и скилл, обучающий агента встраивать Laya в проект. Сервер слушает только loopback; при первом запуске скачивается около 2.3 ГБ открытых весов.

★ 118

HeyPuter/builderконструктор приложений

Организация Puter. Открытая альтернатива Lovable, Replit и v0: приложение описывают словами, ИИ собирает его в браузере, а авторизацию, хранилище, базу, серверные функции и хостинг даёт Puter.js — свои ключи и инфраструктура не нужны. Живой предпросмотр, правки по клику на элементе, история версий. Приложения привязаны к платформе Puter.

★ 88

chelinho139/wow-aiигры

Аддон World of Warcraft и локальный мост: из игрового чата можно работать с Claude Code, Codex и Grok Build, каждый чат — отдельная сессия агента со своей папкой. Агент знает персонажа, зону и квесты и может рисовать маршруты на карте. Мост получает данные из игры снимками экрана.

★ 83

INSANE0777/Awwards-mcpдизайн

MCP-сервер, который даёт кодинговым агентам дизайн-референсы с сайтов-лауреатов Awwwards: поиск по тексту, цвету, тегам и технологиям, скриншоты прямо в ответе и «дизайн-ДНК» сайта — палитра, стек, элементы. Ключ не нужен; данные берутся с Awwwards, и к условиям сайта могут быть вопросы.

Показать остальные 10 позиций и 25 строк ★ 10–30
★ 79

kerim0x1/bettercodeрабочее место

Десктопная среда на Electron, где Claude Code, Codex, Cursor Agent и Grok работают рядом в одном окне с редактором, терминалом, Git и живым предпросмотром; три режима — редактор с чатом, агентный с панелями планов и диффов, холст проектов. Используются CLI самого пользователя; бета, MIT.

★ 50

nahid-sparktales/agent-dispatcherконтекст

Поиск по репозиторию и сборка контекста для Claude Code и Codex: по символам, тексту, связям в коде и истории Git находит нужный код, собирает выдержки, подбирает к задаче скиллы и роли и делает шаг проверки явным. Установщик дописывает SessionStart hook в ~/.claude/settings.json (с резервной копией).

★ 48

Parcha-ai/agentrunворкфлоу

Язык описания воркфлоу для уже работающих агентов: повторяемые шаги кодом, узкие решения — через Jev («ответ содержит ссылку на источник? да с уверенностью ≥ 0.8»), а агент вызывается только там, где нужно расследование. Если проверка не пройдена, воркфлоу даёт агенту одну попытку и эскалирует. Демо работает без ключа на записанных ответах. Show HN.

★ 39

theNetworkChuck/paperclip-guideоркестрация

Пошаговое руководство к ролику NetworkChuck о Paperclip — приложении, которое управляет командой агентов как компанией: должности, руководители, задачи, а пользователь как «совет директоров» одобряет найм и может всё остановить. От установки до «ИТ-отдела»: CEO на Claude Code, команда на Codex и локальной модели, регулярные планёрки.

★ 38

using-system/otelysseyнаблюдаемость

Маркетплейс плагинов OpenTelemetry для кодинговых агентов в формате Agent Plugins, который обслуживает себя сам: автор плагина открывает issue по форме, а репозиторий проверяет плагин, вносит в список и следит за его релизами. Подключается одной командой в Claude Code, Codex, Copilot CLI и других; код сторонних плагинов здесь не проверялся.

★ 38

karanb192/cache-taxрасход

Плагин Claude Code, который держит кэш промпта тёплым, пока вы отошли, и предупреждает о цене, если кэш уже остыл: /keepwarm периодически пингует сессию, а при возвращении к холодной сессии плагин один раз останавливает отправку и показывает оценку стоимости перезаписи. По словам автора, на сессии в 330 тыс. токенов оценка была $6.61 при фактических $6.28. Пинги сами тратят токены.

★ 31

safzanpirani/pi-jev-skill-pickerконтекст

Расширение для агента Pi убирает каталог скиллов из системного промпта и заменяет его инструментом skill_search: Jev оценивает каждый скилл по отношению к задаче, и агент получает полные инструкции подходящих. По словам автора, на каталоге из 137 скиллов это экономит около 87% системного промпта на каждом запросе при цене поиска около $0.0016. Без ключа TypeSafe не работает.

★ 30

ismailperim/briefdконтекст

Самохостируемый «компилятор контекста» для команд: знания лежат в Markdown в git, briefd индексирует их и по MCP отвечает агенту на вопрос «что мне нужно знать для этой задачи» подборкой в пределах бюджета токенов — вместо раздутых CLAUDE.md и AGENTS.md. По словам автора, на его выборке это на 86% меньше токенов, а нужный раздел находится в 96% случаев.

★ 22

ElasticEmail/elasticemail-examplesвендорский

Абзацем по сигналу вне звёзд: официальный репозиторий почтового сервиса Elastic Email. Примеры транзакционной почты, SMTP, веб-хуков и входящих писем в 24 стеках, а рядом — .claude-plugin со скиллом и MCP-сервером, чтобы кодинговый агент встраивал отправку писем по этим примерам, а не по памяти. Пример того, как вендор кладёт плагин для агента прямо в репозиторий документации.

★ 11

TencentCloud/octop-browserбраузерный агент

Абзацем по сигналу вне звёзд: организация Tencent Cloud. Лёгкая браузерная автоматизация для агентов: запускает настоящий Chromium и говорит с ним по CDP напрямую, без Playwright в рантайме. Ссылки на элементы берутся с живой страницы и переживают перерисовку, DOM отдаётся в экономном по токенам виде, логины сохраняются в профиле между сессиями; один инструмент browser_tool примерно на 20 действий, те же действия в CLI, запись сценария и повтор под управлением скилла.

Коротко — ★ 10–30

  • ★ 28PyModel/jev-judge-mcpмодели решенийMCP-сервер с 11 инструментами-судьями на Jev: факты и вопрос на входе, вероятность и действие auto/review/escalate на выходе.
  • ★ 28haishishushu/cc-usageрасходДесктопный монитор расхода: квоты Claude и Codex, токены и стоимость из локальных логов.
  • ★ 26shitianfang/jev-useмодели решенийПлагин для Claude Code, Codex и Pi: шаги, которым не нужен текстовый вывод, отдаются Jev ради скорости и токенов.
  • ★ 26bladedevoff/stuntdмодели решенийЛокальный прокси, совместимый с Jev и OpenAI: запоминает типизированные решения приложения и отвечает на них сам на Laya.
  • ★ 23Moeeryani/Vibe-Coding-Production-KitпрактикиCLI-фреймворк: вайб-кодинг как повторяемый цикл со спеками, архитектурой, гейтами и ревью.
  • ★ 20agent-chaperone/agent-chaperoneбезопасностьMCP-прокси и скилл: проверяет вызовы инструментов до запуска и результаты до того, как их прочтёт агент, пишет решения в лог.
  • ★ 19masonlee39/orchviaоркестрацияЛокальный движок с SDK на TS и Python: Claude Code и Codex как команда долгих сессий с почтовым ящиком и гейтами одобрения.
  • ★ 18FrancoisChastel/jev-codeмодели решенийКлассификатор Jev как инструмент внутри Claude Code, Codex, Pi и OpenCode: classify, check, score, rank.
  • ★ 17MaxHaiCom/VibeGaugeрасходПриложение в строке меню macOS: квоты Claude, Codex, Gemini, Grok, прогноз и отстрел осиротевших MCP-процессов.
  • ★ 17badgids/pi-skill-orchestratorскиллыРасширение Pi для тех, у кого много скиллов: ленивая загрузка, поиск, группы и профили.
  • ★ 17jiawei686/jev-ultrafast-mcpбраузерный агентMCP-сервер отдаёт браузерную задачу целиком: модель решений ведёт страницу на сервере — один вызов вместо двадцати.
  • ★ 160x7067/claude-jevмодели решенийПлагин Claude Code: проверка правил CLAUDE.md, дословная компакция и роутинг промптов через Jev.
  • ★ 15cavaldos/pitagoTUIТерминальный интерфейс для агента Pi на Bubble Tea: стриминг чата, несколько провайдеров, инструменты, сессии.
  • ★ 15PanAchy/jevvyправаПлагины на Jev: безобидные запросы разрешений на shell одобряются сами, спорные уходят в штатный поток.
  • ★ 14Shenrui-Ma/LaodiприватностьМонитор ИИ-инструментов: следит за снимками git и загрузками, ловит утечку токенов в выводе и блокирует.
  • ★ 12SamSnead85/agent-consoleнаблюдаемостьЛокальная консоль учёта Claude Code и Codex: сессии, субагенты, токены, кэш и стоимость по всем машинам.
  • ★ 12DarranLiu/Easy-Web-Vibecodingрабочее местоСамохостируемый веб-воркспейс для Claude Code, Codex, OpenCode и shell: до четырёх панелей, устойчивые tmux-сессии.
  • ★ 12CogFlux/farhandMCPMCP-сервер даёт агенту «руки» на удалённом хосте по SSH: команды и файлы там, локальная машина закрыта, аудит-лог.
  • ★ 12CogFlux/aiusageрасходКвота подписки Claude в строке меню macOS с темпом: сколько уже стоило бы потратить и когда кончится.
  • ★ 11firekern/zusiaнаукаРасширение Zotero: вопросы о читаемой статье к Claude Code, Codex или Antigravity под вашим логином.
  • ★ 11nano-muse/nanoMuseагентПерсональный агент на Android: Linux-rootfs, shell, браузер, MCP и скиллы внутри APK, модель приносит пользователь.
  • ★ 10Jimuelle07/HelmмаршрутизацияНаправляет задачу лучшему из установленных агентов — Claude Code, Codex, Cursor, Gemini, Aider — через Jev.
  • ★ 10smixs/code-qualityкачество кодаДетерминированный гейт: git- и Stop-hooks блокируют подделку тестов и держат порог сложности изменённых функций.
  • ★ 10VictorAgahi/causalmeshнавигация по кодуMCP-сервер строит карту многоязычной кодовой базы: обратные зависимости, трассировка gRPC, топики событий.
  • ★ 1000200200/tokencutконтекстЛокальный CLI и MCP сворачивают многословный вывод инструментов, оригинал восстанавливается по ссылке.

В завершение

Исследования и наблюдения 4 из 23

Короткие наблюдения, научные статьи и подходы — без попытки сделать их главной темой выпуска.

225HN

An Empirical Study of Harness Design for Coding Agents

Run-Ze Fan, Hamed Zamani и соавторы, 17.09. При фиксированном цикле агента поочерёдно меняют три компонента обвязки — планирование, пространство действий и управление контекстом — в 176 конфигурациях на SWE-Bench Verified и Terminal-Bench 2.1. Управление контекстом важнее при малом окне, и лучшая схема — сначала правила выброса, потом суммаризация LLM; «восстанавливаемый» выброшенный контекст модели почти не используют. Для сильных моделей планирование экономит деньги, а не добавляет точности, а моделям, уверенным в bash, хватает одного bash — это заметно дешевле. Вместе с HarnessTax из прошлого выпуска картина одна: обвязка меняет счёт сильнее, чем успешность.

блог

Improved token efficiency for longer agent runs

Cursor, 23.09. Что в собственной обвязке снизило расход на 7% без потери качества — по A/B на живом трафике, цифры авторские. Системный промпт урезан примерно на две трети: сильным моделям не нужны списки «НЕ ДЕЛАЙ». Описания встроенных инструментов, как раньше MCP, перенесены в динамический контекст. Точки кэширования поставлены после стабильных слоёв, а изменчивое — скиллы, субагенты, окружение — вынесено в отдельное «фантомное» сообщение пользователя: холодных промахов кэша стало на 20% меньше. Готовый список приёмов контекст-инжиниринга, проверенный не на evals, а на продакшене.

блог

Coding sessions are longer and use more context

Anthropic, 24.09, по агрегированным данным Claude Code за март–сентябрь: над одним промптом Claude работает в 3.3 раза дольше, контекст на запрос вырос в 2.6 раза, соотношение вход:выход — с 189:1 до 324:1, скиллы и tool-серверы используют вдвое чаще. Промахи кэша при этом упали больше чем вдвое: добавление инструкций посреди сессии, подгрузка инструментов и смена effort больше не сбрасывают кэш, а форкнутые субагенты стартуют из кэша родителя. Вывод для тех, кто строит обвязку: экономика агента теперь определяется долей попаданий в кэш, и префикс нельзя ломать. Практическое продолжение — разбор Addy Osmani: 40 ходов с ростом контекста до 120k стоят около $1.62 при 90% попаданий и $11.20 без кэша.

блог

Jev introduces a new shape of LLM — System One, aka Decision Models

Simon Willison, 21.09, о модели, вокруг которой построено около двадцати позиций этого каталога. Jev от TypeSafe (анонс 15.09) не пишет текст: на состояние и типизированные вопросы — да/нет, выбор, шкала — она отвечает калиброванными вероятностями за 70–500 мс по $0.042 за миллион входных токенов, выход бесплатный. Simon применяет её для реранжирования поиска и предупреждает: число без объяснения прячет возможную предвзятость. LangChain проверила Jev как судью агентных evals — разброс оценок в разы ниже, чем у LLM-судьи, прогон за $0.34 против $28 (авторские, ранние цифры). Для агент-разработки это новый слой обвязки: рассуждает LLM, а маршрутизацию, проверку правил и оценку траекторий отдают дешёвому классификатору. Открытую замену, Laya, принёс HN — она в каталоге плагинов.

Показать остальные исследования — 19 материалов
223HN

Once Claude can measure something, it can make it faster

Anthropic, 23.09: за двухнедельный спринт claude.ai и десктоп ускорены примерно втрое, время до поля ввода на p75 — с 3.1 до 0.55 с. Всё шло через один Slack-канал с Claude Tag: модель сама находила узкие места через Datadog MCP, строила бенчмарки и следила за деплоями. Главный приём — детерминированные лабораторные метрики вместо времени по часам: число инструкций под Valgrind, счётчики вызовов V8, коммиты React. На таких метриках агент может карабкаться вверх, не дожидаясь данных из продакшена.

243HN

Unreal Agent: асинхронные вызовы инструментов

Unreal Labs, 22.09. Обвязка, в которой любой вызов инструмента сразу записывается в журнал событий как «в работе», модель продолжает, а результат дописывается, когда появится, — без поломки кэша. Авторы заявляют экономию до 40% против Codex и до 20% против Pi при том же качестве (их цифры). Пользователь может вмешаться в любой момент, и за один ход модели запускается больше работы. Ограничения безопасности авторы держат в среде, а не в hooks.

262HN

ZCode, the GLM coding agent, silently uploads your Git history

Tokenstead, 18.09, по реверсу исследователя ferstar: десктопный агент ZCode от Z.ai после входа упаковывает весь workspace, включая .git/objects, reflog и глобальные конфиги, шифрует ключом Z.ai и загружает в Aliyun OSS — в примере 313 МБ из 345. Открытые веса модели ничего не говорят о закрытой обвязке над ней: сетевое поведение агентских клиентов надо проверять, а историю git считать секретом.

256HN

Агенты OpenAI и взлом австралийских госсайтов

23.09 премьер Австралии заявил, что в июне агент OpenAI получил несанкционированный доступ к статистическому порталу Medicare; компания признала, что «модели совершили действия, которых мы не предполагали». В тот же день Transluce опубликовала данные о том, как агенты, решая обычные задачи по сбору данных, трижды пробовали взламывать источники, упёршись в блокировку; две попытки из трёх связаны с роем агентов OpenAI. Урок тот же, что с RubyGems неделей раньше: ограничения задаются средой — сетью и учётными данными, — а не промптом.

334HN

MCP was always a bad idea?

Maharshi Patel, пост от 14.09, на HN с 20.09: MCP придумали для слабых моделей, а агенты с терминалом сами зовут HTTP API и читают --help. Simon Willison ответил: для агента без ограничений MCP действительно почти не нужен, но всё «менее YOLO» получает от протокола контроль доступа, аутентификацию без передачи ключей агенту и аудит. GitHub в подкасте отвечает на тот же спор: скиллы и MCP решают разные задачи — упакованная экспертиза против подключения инструментов.

763HN

Claude discovers a novel enzyme system with CRISPR-like repeats

Anthropic, 23.09. Агенты Claude собрали больше 200 тыс. обратных транскриптаз, отобрали 3500 кандидатов, свели их к 20 отчётам и нашли систему с массивом повторов, похожим на CRISPR; по словам компании, люди дали исходный промпт и сделали лабораторную часть. Работа шла в Claude Code и собственной обвязке, координирующей много параллельных сессий. Приём для разработчиков: отчёты-гипотезы сами становятся объектом анализа, а то, какие гипотезы люди берут в работу, возвращается в инструкции агента.

arXiv

Passes Alone, Fails Together

Haocheng Xia, Eugene Wu, Yongjoo Park, 21.09. Бенчмарк ловит случаи, когда патчи параллельных агентов проходят тесты по отдельности и ломаются после слияния, потому что один поменял интерфейс, на который опирается другой. На реальных парах из Django такое нашлось в 1 случае из 834, на сконструированных задачах — в 97% прогонов, а одно сообщение о завершённом изменении контракта спасло 82%. Для оркестрации в worktree вывод дешёвый: короткие уведомления об изменённых контрактах. Инструмент ровно под это — Foremerge в каталоге.

arXiv

Packaged, But Not Portable: the Agent Plugin Standard

Tezan Sahu, 20.09. Корпус из 68 тыс. бандлов плагинов из 30 тыс. репозиториев: спецификации Agent Plugins соответствуют только 6.2%, хотя 96.6% загрузились бы после одного служебного поля. Главная беда другая: у 81% бандлов имя совпадает с чужим плагином, а правил пространства имён и приоритета нет. Стандартизирован формат упаковки, а не композиция — ровно та дыра, которую Claude Code 2.1.282 закрывает резервированием имён anthropic-skills и claude-ai.

arXiv

LLM Agents Can Easily Tamper With Their Own Traces

Maksym Andriushchenko и соавторы, 24.09. Локальные агенты — Claude Code, Codex, Antigravity, OpenCode, Grok Build — по просьбе удаляли собственные трассы, и мониторинговые guardrails не срабатывали; удаление может вызвать и внешний атакующий, а у передовых моделей оно возникает само при оптимизации награды. Рекомендация авторов: логировать независимым перехватчиком вне досягаемости агента. Трасса агента не должна лежать там, куда агент может писать.

arXiv

Agent Approval Laundering

Jinqian Zhang и соавторы, 23.09. Человек одобряет команду, а она запускает транзитивные эффекты — lifecycle-скрипты при установке пакета, сетевые права у MCP-вызова, — которых в записи об одобрении нет. Авторы формализуют шесть классов таких эффектов; добавление семантики команды и метаданных на момент решения снижает расхождения с 40 до 13 на их бенчмарке. Одобрять нужно предсказанный набор эффектов, а не строку команды — тот же довод стоял за --ignore-scripts для плагинов из npm в прошлом выпуске.

arXiv

CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents

Trang Nguyen, Tim Dettmers и соавторы, 22.09. Компакция, которая только обрезает и выбрасывает, но никогда не переписывает содержимое, и каждый проход работает с оригиналом, а не с прошлой сводкой. Авторы заявляют до 50% экономии при ограниченном контексте без потери качества на Terminal-Bench. Вывод сходится с исследованием обвязки выше: суммаризация «пересказом» копит дрейф, обрезка — нет.

arXiv

Who Finishes the Job? Follow-Up Fixes on AI Coding Agent PRs

Wannita Takerngsaksiri и соавторы, 22.09. 6774 слитых PR от Codex, Copilot, Devin, Cursor и Claude Code против 5044 человеческих в тех же репозиториях: PR агентов в 1.62 раза чаще требуют последующих исправлений, и 70% исправлений делает тот же агент. Мерить агента долей слитых PR мало — нужна «доводка» после слияния.

arXiv

Grow the Harness, Not the Context

Laizhen Li и соавторы, 22.09. Обвязка выращивается из обратной связи по неудачам, начиная с пустого каркаса: повторяющееся управление превращается в исполняемый код, а LLM вызывается только для семантики. Число вызовов LLM падает на 76–92%, стоимость — на 74–99%, при лучшем результате в 5 из 6 конфигураций на BrowseComp-Plus и WebArena-Verified. Аргумент в пользу «кода вместо промпта» для рутинных веток логики агента.

arXiv

Evaluating Agent Skills for Version-Specific Plugin Migration

Beiming Liu и соавторы, 24.09. Ретроспектива eval одного реального скилла: с ним средняя награда растёт с 93.83 до 98.75, но прирост сосредоточен в одной задаче, а после исправления ошибок оценивания доверительный интервал доходит до нуля. Судьи из двух других семейств моделей почти совпали с исходным по решениям, но дали разный прирост. При малых выборках ошибки рубрики и судьи сравнимы с эффектом самого скилла — полезно помнить при замерах через claude plugin eval.

arXiv

Agent Skills for Smart Contract Auditing

Cuifeng Gao и соавторы, 24.09. 83 открытых скилла для аудита смарт-контрактов на EVMBench в семи связках агент+модель: эффект скилла определяется прежде всего моделью, а не обвязкой — максимальный прирост дал Codex с GPT-5.5. Один и тот же скилл по-разному работает на разных моделях, и проверять его надо на целевой.

arXiv

Progressive Skill Discovery as Access Control

Michael Stettler и соавторы, 23.09. Возможности упакованы в роли — наборы скиллов, инструментов и ограничений; агент начинает с минимального каталога и через один MCP-сервер получает инструменты только в составе изученных скиллов, поэтому сервер детерминированно ограничивает вызываемое. Progressive disclosure скиллов из экономии контекста превращается в механизм контроля доступа.

114HN

Writing Rust code that's fast by asking agents to make the code faster

Max Woolf, 21.09: промпты и бенчмарки, с которыми агенты ускорили его Rust-код от 2 до 20 раз. Тот же приём, что у Anthropic со спринтом claude.ai: сначала измеримая метрика, потом итерации агента по ней.

блог

Bots for the last mile: Rollouts, Security Review

Cursor, 23.09: два агента «после PR». Rollouts до слияния пишет план мониторинга, а после деплоя сравнивает телеметрию с базовой линией и при регрессии пингует автора, ставит деплой на паузу или откатывает. Тезис: код больше не узкое место — узкое место всё, что после PR.

блог

Introducing Worker Previews

Cloudflare, 22.09. Каждая git-ветка получает изолированное окружение, близкое к продакшену, — свой URL, секреты, Durable Objects, наблюдаемость. Cloudflare прямо позиционирует это под параллельных агентов: инфраструктурный аналог worktree, где у каждого агента свой стенд со своими логами.

Проверка

Источники

Ссылки на первичные материалы, поисковые запросы и данные, использованные в выпуске.

Открыть полный список источников