Почему ИИ-агенты ошибаются без причины: одинаковый запрос — разные решения

Современные агенты на базе больших языковых моделей (LLM), способные выполнять сложные задачи с помощью инструментов и последовательного рассуждения, всё чаще внедряются в реальные приложения. Однако остаётся малоизученным вопрос: насколько их поведение стабильно при одинаковых входных данных? Это важно для отладки, оценки и надёжности таких систем.В попытке ответить на этот вопрос проведено систематическое исследование поведенческой согласованности агентов на трёх моделях (Llama 3.1 70B, GPT-4o, Claude Sonnet 4.5) с использованием датасета HotpotQA. Этот набор данных, содержащий вопросы с...
Copyright information of photo and video materials was taken from the website «iXBT.com» , more details in our Terms of Use