Саморазвивающиеся агенты: не чатбот, а система, которая переписывает себя
На X давно шумят про «ИИ, который сам себя улучшает». Часть — хайп. Часть — уже рабочие репозитории, бенчмарки и ночные циклы, где агент без человека правит свои промпты, инструменты и даже архитектуру цикла.
Это другой уровень, чем «спросил GPT — получил ответ». Здесь агент не заканчивает работу на ответе. Он измеряет свой результат, находит слабые места, меняет себя и запускает следующий круг.
Что именно «саморазвивается»
Важно не путать с фантастикой, где нейросеть сама переобучает свои веса с нуля. В практике 2025–2026 самоулучшение почти всегда идёт по двум путям (это прямо зафиксировано в свежем обзоре Self-Improvements in Modern Agentic Systems, arXiv:2607.13104, который продвигал @SchmidhuberAI):
- Модель — дообучение, синтетические данные, reward-сигналы.
- Scaffold / harness — промпты, память, инструменты, оркестрация, код агента. Веса модели могут быть зафиксированы; меняется «обвязка».
Именно второй путь сейчас даёт самые ощутимые результаты на открытых бенчмарках: агент читает свои трейсы ошибок и переписывает собственный harness.
Кто это уже делает (с именами)
AutoAgent — релиз @kevingu
Мета-агент сутками крутит эксперименты над рабочим агентом: правит промпты, добавляет инструменты, смотрит failure traces, оставляет только то, что поднимает метрики. После 24+ часов автономной оптимизации — #1 на SpreadsheetBench (96.5%) и сильный результат на TerminalBench, обогнав ручные harness'ы. Репозиторий: github.com/kevinrgu/autoagent
EvoAgentX — @EvoAgentX
Фреймворк, где мультиагентный граф строится из одной цели, затем сам себя оценивает и мутирует. Не «один раз сгенерировал пайплайн», а цикл: build → eval → evolve. GitHub: github.com/EvoAgentX/EvoAgentX. Рядом — кураторский список Awesome-Self-Evolving-Agents (таксономия, бенчмарки, papers 2023–2026).
Exo — @AlexKrentsel
Агент, который может переписывать любую свою часть: политики, окружение, даже cost-оптимизацию. Долгоживущий, локальный, без вечного «approve this change».
Spark — agent.sparkswarm.ai
Персональный агент с ночным «залом»: крутит loops, прогоняет бенчмарки, промоутит удачные tool'ы и паттерны памяти, слабые выкидывает. Утром ты видишь отчёт: что выросло, что убито.
AREX (китайский research-агент)
Не один ответ, а рекурсия: исследование → аудит каждого утверждения → память отвергнутых путей → новые targeted-запросы → до 300 research-actions и несколько outer-раундов self-improvement. Маленькая версия (~4B) на части deep-research бенчмарков обгоняла куда более крупные модели. Важно: это process-level recursion (улучшение процесса исследования), а не sci-fi «сам переписал нейросеть».
Hermes (Nous Research)
Self-improving agent с памятью, scheduled jobs, tool use; уже как 1-click на DigitalOcean Marketplace — то есть не только paper, а деплой.
Отдельно в X-тусовке всплывали Superior Agents (в т.ч. через @KIPprotocol): агенты, которые сами крутят стратегии роста аудитории в X и торговые петли — analyze → execute → learn from outcome.
Почему это «новый уровень»
Обычный LLM — статичный срез. Self-improving agent — петля:
цель → действие → измерение → диагноз ошибок → правка harness/навыков → снова действие
Человек задаёт цель и критерии успеха. Дальше система сама:
- копает recurring failures;
- предлагает патчи к промптам/инструментам/оркестрации;
- прогоняет регрессию («старые задачи не сломались?»);
- оставляет улучшение или откатывает.
На практике это уже бьёт ручной harness engineering на TerminalBench, SWE-подобных задачах, spreadsheet-агентах. Не всегда. Не магически. Но систематически — там, где есть eval и трейсы.
Andrew Ng и другие в индустрии прямо говорят: следующий шаг после «агентов» — self-improving loops. Не лучший разовый промпт, а цикл, который крутится ночью, пока ты спишь.
Где хайп, а где мясо
Хайп: «ИИ сам себя переписал и стал богом».
Мясо: мета-агент 24 часа правит harness фиксированной модели и обгоняет команду инженеров на узком бенчмарке.
Хайп: один твит-бот «живёт своей жизнью».
Мясо: EvoAgentX / AutoAgent / Spark / Exo — открытый код, метрики, откаты, eval.
Риск
Риск тот же, что у любой автономии: дрейф целей, дорогие API-петли, хрупкость без хороших тестов. Поэтому взрослые системы всегда держат измерение + rollback. Без этого «саморазвитие» быстро превращается в саморазрушение.
Зачем это читателю x402 / агентной экономики
Агент, который только отвечает, — расход.
Агент, который улучшает свой pipeline и платит за лучшие tool'ы/данные по x402, — уже бизнес-единица.
Self-improving loop + платный каталог API (agentic.market и аналоги) = агент сам находит, что купить, сам платит, сам встраивает, сам проверяет, выросло ли качество. Человек задаёт KPI. Машина крутит эволюцию scaffold'а.
Это не «ещё один чат». Это смена единицы работы: от промпта к непрерывному улучшению системы, которая промпты пишет сама.
Следить по делу, а не по мемам: @kevingu (AutoAgent), @EvoAgentX, @SchmidhuberAI (survey RSI), @AlexKrentsel (Exo), репозитории awesome-Self-Improving-Agents / Awesome-Self-Evolving-Agents.
Кто крутит loops — накапливает преимущество каждую ночь. Кто всё ещё пишет один промпт за раз — конкурирует с системой, которая за это же время сделала сотню итераций над собой.
Читайте также: Они торгуют лучше людей · Как залистить агента на agentic.market