31 августа — 7 сентября 2026

AI-статьи недели
с HackerNoon

Девять воспроизводимых методов для агентов, RAG и rollout моделей.

234 статьи9 карточек4 на радаре

Неделя показывает, где агентам нужны проверяемые границы: между ownership и записью, ответом и retrieved data, webhook и handler, новой моделью и трафиком. В карточках оставлены методы; неподтверждённые эффекты названы ограничениями.

Основные карточки

О чём → Главное → Попробовать за вечер.

01

Один writer, один worktree, один human gate

✍ Pavel Kuzinai-agentssoftware-engineering
О чём. Параллельная работа агентов над несколькими репозиториями требует явного владения и изоляции.
Главное.
  • Выделяйте отдельные worktree и build artifacts.
  • Запускайте local CI перед push и ставьте human gate между стадиями.
  • Не повторяйте spawn, пока не исключили частичное создание: это не универсальный API-закон.
Попробовать за вечер.
  • Разделите один change по worktree и владельцу.
  • Добавьте CI в merge-checklist.
  • Метрика: конфликты и ручные исправления на change.
02

Approval как typed WebSocket-протокол

✍ Huy Nguyenpydantic-aiwebsocket-agents
О чём. Deferred tools Pydantic AI останавливают run до решения человека, а typed message contract связывает backend и UI.
Главное.
  • Разделите final output и DeferredToolRequests.
  • Возобновляйте run через ToolApproved/ToolDenied и сохранённую историю.
  • FunctionModel тестирует flow офлайн; production требует auth и durable approvals.
Попробовать за вечер.
  • Пометьте destructive tool как requires_approval.
  • Добавьте approval_request и tool_decision в schema.
  • Метрика: тест подтверждает отсутствие действия до approval.
03

Сопоставляйте ответ с retrieved candidates

✍ Peter Dongoon-device-airag
О чём. On-device LLM называла несуществующие snippets, пока поиск и выбор не стали разными этапами.
Главное.
  • LLM даёт search words, deterministic retrieval — реальные записи.
  • Принимайте только ID/title из переданного списка кандидатов.
  • Apple/Core Spotlight — конкретный стек; substring-match не доказывает смысл.
Попробовать за вечер.
  • Логируйте candidates и выбранные ID.
  • Отклоняйте несопоставленный ID.
  • Метрика: доля ссылок вне retrieved set.
04

Не смешивайте «не искал» и «плохо нашёл»

✍ trpevskirag-evaluationtool-calling-agents
О чём. Agentic RAG может не вызвать retrieval tool; пустой contexts тогда искажает средние retrieval-метрики.
Главное.
  • Сохраняйте tool_called и retrieval_count для каждой строки.
  • Разделяйте context precision/recall и generation scores.
  • Judge-метрики стоят API-вызовов и не оценивают правильность решения искать.
Попробовать за вечер.
  • Добавьте tool trace в eval.
  • Постройте separate means для search/no-search.
  • Метрика: доля low retrieval scores без tool call.
05

Аудит данных до agentic deployment

✍ Sagar Sahnidata-qualityagentic-ai
О чём. Рамка проверяет taxonomy, структуру, source of truth и traceability исходов до запуска агента.
Главное.
  • Оцените каждый слой от 0 до 3 с evidence.
  • Сравните живые документы с шаблонами.
  • Порог 6/12 — авторская эвристика, а не прогноз успеха.
Попробовать за вечер.
  • Выберите 20 документов.
  • Отметьте taxonomy, source of truth и outcome link.
  • Метрика: балл слоя и число конкурирующих источников.
06

Одна валидация, затем deterministic fallback

✍ Deyon Andersonsoftware-architectureautonomous-ai-agents
О чём. Boundary приложения валидирует JSON/schema и вместо endless reprompt вызывает rule-based fallback.
Главное.
  • Разбирайте output через Pydantic до execute_action.
  • После parse/schema error переходите к fallback.
  • Latency и экономия из статьи не подтверждены тестом.
Попробовать за вечер.
  • Оберните один output в BaseModel.
  • Сделайте safe fallback.
  • Метрика: повторные LLM-вызовы после schema failure.
07

Verify → persist → acknowledge → schedule → reply

✍ Photonconvexai-agents
О чём. Convex/Photon component выносит inbound и outbox вокруг agent handler.
Главное.
  • Пишите verified delivery до HTTP 200.
  • Dedup — provider ID и deterministic client GUID.
  • Cancellation проверяется после slow work; delivery на телефон не доказана.
Попробовать за вечер.
  • Разделите webhook и handler durable row.
  • Проверьте cancellation перед send.
  • Метрика: duplicate delivery и stale reply.
08

Golden set, shadow, canary, drift

✍ Rishi Bhandarifine-tuningmlops
О чём. Специализированную модель выводят через validated traces и staged comparison с baseline.
Главное.
  • Golden dataset включает SME corrections.
  • После shadow начните 1–5% canary и KPI ramp.
  • Сроки, экономика и regulation claims — эвристики без training config.
Попробовать за вечер.
  • Определите узкую задачу и schema лога.
  • Соберите 20 примеров для review.
  • Метрика: quality candidate vs baseline на golden set.
09

Переносите повторяемые правила в границы системы

✍ Dmitriy Fedoryshchevclaude-codeagentic-coding
О чём. Pre-compaction hook возвращает правило перед summary; устойчивые правила уходят в permissions, tests и build boundaries.
Главное.
  • Trigger — правило, которое уже повторяли несколько раз.
  • Закрывайте write paths и делайте definition of done внешней.
  • Это ретроспектива одного harness, не доказательство универсальной надёжности.
Попробовать за вечер.
  • Найдите одно нарушение после compaction.
  • Перенесите его в hook или test.
  • Метрика: повторы на пять сессий.

На что обратить внимание

Read-only audit repo

Проверяйте untrusted repo вне него и ничего не исполняйте. Нет validated sandbox-контура.

HackerNoon

Cold-test skill discovery

Проверьте, откроет ли новый агент skill сам; три предложения — эвристика.

HackerNoon

Multi-agent triage

Разделяйте harness, reasoning budget и transport payload; это личный опыт автора.

HackerNoon

Token cost markup

Считайте wrapper и body своим tokenizer: 11 tokens и 94% не переносятся.

HackerNoon

Мой план на неделю

Добавить tool trace в RAG eval до среды
Покрыть approval без LLM до пятницы
Перенести одно правило в проверяемую границу до воскресенья

Данные выпуска

Окно: 31 августа — 7 сентября 2026.

Корпус: 234 статьи из поискового индекса HackerNoon; covers_window: true; отказов: 0.

В дайджест: 13 материалов: 9 основных и 4 на радаре. Непрочитанный ranked reserve: 52.

Счётчики прочтений доступны для 194 из 234 статей и не использовались для отбора.