На каких моделях работает агент
Мы не обучаем свою модель — мы берём сильнейшие из доступных и отвечаем за то, какие именно. Здесь видно, где они стоят по независимым оценкам и как мы проверяем агента на своих задачах.
Независимые оценки
Полный рейтинг Artificial Analysis, от сильной модели к слабой. Цветом отмечены тарифы «Сам Решу». Ниже сводного индекса — каждая отдельная оценка, из которых он складывается.
Наши проверки
Публичные бенчмарки меряют модель, а не работу агента с вашими данными. Для этого у нас 17 доменных наборов и больше сотни сценариев — закупки, таблицы, документы, исследование рынка, — где ответ оценивают рубрики и модель-судья.