ллм агенты. мой путь через этот хайп (so far)
помните как в начале ChatGPT все думали что через год программисты не будут нужны? с агентами была похожая история – казалось что вот-вот они заменят кучу рутинной работы
пару месяцев назад я поймал этот хайп и решил собрать агента-исследователя. идея была простая: дать ему доступ к базе данных всех статей с arXiv-а и метаданным большинства DOI объектов. спросишь у него вопрос на любую научную тему, он найдет релевантные статьи (хоть и забытые) и составит ответ
демо собрать было просто. но когда дошло до реального приложения…
[хайп фаза] сначала я был на классическом хайпе. читаешь про агентов, смотришь дэмо – кажется что они могут все. дай им инструменты и они сами будут планировать, решать задачи, исправлять ошибки
из-за положительного опыта с вайб кодингом сложилось впечатление что этот опыт транслируется и в другие применения. если ИИ может написать код по описанию, то почему бы ему не проводить исследования?
[overwhelming фаза] потом начал пробовать. столько фреймворков, статей, методов попробовать. каждый обещает что он лучший, у каждого свои подходы. читал документацию одного, переключался на другого, в итоге ничего не делая
ппц напомнило борьбы между js фреймворками когда я начинал и пытался выбрать.. Angular, React, Vue… Next.js, Vite,… сидишь не знаешь с чего начать
LangChain, AutoGPT, CrewAI, Haystack… каждый день новый стартап с “революционным подходом к агентам”
[фаза разочарования] когда наконец выбрал стек и начинал собирать – приходит разочарование
агент “забывает” что делал 10 шагов назад из-за лимита контекста. ты даешь ему задачу найти статьи по квантовым вычислениям, он находит одну статью, потом через пару шагов спрашивает “а что такое квантовые вычисления?”
галлюцинирует информацию которой у него нет. говорит что нашел статью от 2025 года, а при проверке оказывается что она от 2019 и вообще не по теме
зацикливается на одной задаче и тратит все токены. дашь ему задачу поискать в базе, он начинает искать, находит что-то, решает что нужно уточнить поиск, ищет снова, снова уточняет… и так пока не закончатся токены
а иногда просто говорит “не знаю” там где любой человек очевидно разобрался бы
особенно бесит когда делаешь агента для конкретной задачи, он работает стабильно в 80% случаев, а в остальных 20% творит такую дичь что проще было бы самому сделать
[фаза понимания] но потом понимаешь что проблема не в агентах, а в том как ими пользуешься
они не замена человеку, а инструмент который нужно правильно настроить. как любая новая технология – нужно время чтобы понять где она работает, а где нет
с моим исследовательским агентом я понял что проблема была в том что я пытался сделать его слишком универсальным. когда я сузил его задачи до конкретных типов запросов и добавил четкие guard rails – он стал работать намного лучше
[где я сейчас] сейчас я прохожу фазу “набивания руки” – пробую быстро собирать разные системы и смотрю что получается
пока что мои агенты далеки от чего-то usable, но если правильно ограничить их область действий – они могут быть полезными
самое главное что я понял: агенты хороши для задач где есть четкий алгоритм действий, но нужна гибкость в выполнении. они плохи для задач где нужно креативное мышление или понимание контекста
например, мой агент отлично справляется с поиском статей по конкретным keywords и их фильтрацией, но не может оценить качество исследования или понять его актуальность
хайп пройдет, как всегда, но технология останется. просто нужно найти ей правильное применение