Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Qdrant i minima obespechivayut v 292 raza bolshe agentskih zadach rag na odin gp
Dev48

© 2026 · All rights reserved.

Qdrant и Minima обеспечивают в 2,92 раза больше агентских задач RAG на один GPU-час

Источник: Qdrant

Qdrant и Minima обеспечивают в 2,92 раза больше агентских задач RAG на один GPU-час

Источник: Qdrant

Сокращение количества поисковых запросов и вызовов. Когда агент с генерацией, дополненной поиском (RAG), работает, ему часто приходится планировать поиск, проверять полученные доказательства и пробовать снова, если этих доказательств недостаточно. Эти неэффективности суммируются. Каждый…

26 сентября 2026 г.

Сокращение количества поисковых запросов и вызовов

Когда агент с генерацией, дополненной поиском (RAG), работает, ему часто приходится планировать поиск, проверять полученные доказательства и пробовать снова, если этих доказательств недостаточно. Эти неэффективности суммируются. Каждый дополнительный поиск и каждый дополнительный вызов модели увеличивают задержку, контекст и стоимость вывода.

Чтобы снизить эти затраты, Minima создала агент с ограниченным поиском. Он планировал запрос, искал данные в Qdrant, решал, достаточно ли доказательств, и перефразировал запрос, если их было недостаточно. Затем он генерировал ответ со ссылками с помощью Qwen3.6-27B. Qdrant выполнял гибридный поиск, применял фильтры полезной нагрузки и запускал ранжирование с поздним взаимодействием. Minima обрабатывала каждый запрос на одном графическом процессоре NVIDIA RTX PRO 6000 Blackwell с 96 ГБ памяти.

По результатам 1800 оцененных задач и 10 000 полных эпизодов работы агента, совместный стек достиг показателя 3750 задач на GPU-час по сравнению с 1350 для плотного поиска с выводом в формате BF16. Медианная задержка выполнения задачи снизилась с 21,3 до 7,7 секунд, успешность выполнения задач с опорой на данные выросла с 80,1% до 84,2%, а успешная пропускная способность увеличилась с 1081 до 3158 задач на GPU-час.

Что мы тестировали

Minima выполнила 1800 многошаговых задач по трем публичным бенчмаркам: SciFact, FiQA и HotpotQA, а также по четвертому набору, созданному Minima для тестирования фильтрации полезной нагрузки. В этом четвертом наборе каждый фрагмент содержит идентификатор арендатора и версию документа в полезной нагрузке Qdrant, а каждый запрос имеет ровно один правильный срез «арендатор-версия». Любой результат, возвращенный из-за пределов этого среза, считается нарушением, поэтому набор оценивается по принципу «прошел/не прошел» без участия оценщика. Именно этот набор лежит в основе теста политики арендаторов из 50 000 запросов, о котором рассказывается далее в этой статье. В каждом запуске использовались одинаковые промпт агента, схема инструментов, правило остановки и максимум два вызова Qdrant на эпизод. Ответы были ограничены 256 выходными токенами. Затем Minima воспроизвела 10 000 полных эпизодов на одном миллионе фрагментов по 400 токенов и провела отдельный тест состязательной фильтрации из 50 000 запросов для каждого условия поиска.

Во всех трех конфигурациях использовались одинаковое оборудование, чекпоинт Qwen3.6-27B, настройки сэмплирования, шаблон промпта агента, параллелизм и эндпоинт. Qdrant работал на собственном хосте. Кодирование запросов выполнялось на отдельном сервисе FastEmbed, работающем только на CPU, на базе ONNX Runtime, с использованием одних и тех же моделей во всех трех конфигурациях: sentence-transformers/all-MiniLM-L6-v2 для 384-мерных плотных векторов с косинусным расстоянием, qdrant/bm25 для разреженных векторов и answerdotai/answerai-colbert-small-v1 для 96-мерных мультивекторов с поздним взаимодействием. Qdrant хранил и искал разреженные векторы и применял свой модификатор IDF. Ни один GPU не выполнял работу по кодированию, поэтому RTX PRO 6000 Blackwell был выделен исключительно для эндпоинта Minima Qwen3.6-27B. Задержка эпизода и пропускная способность задач измерялись от начала до конца, включая кодирование и поиск, в то время как показатели GPU-часов и стоимости GPU учитывают только этот выделенный GPU для вывода. Стратегия поиска и сжатие Minima были единственными переменными, которые менялись между запусками. Minima принимала конфигурацию только в том случае, если качество выполнения задач оставалось в пределах 1 процентного пункта от BF16 при фиксированном поиске, качество цитирования сохранялось, а завершалось не менее 99,5% эпизодов. Векторы запросов были предварительно вычислены только для измерения изолированной задержки Qdrant. Сквозной запуск агента включал планирование, эмбеддинг, поиск, проверку доказательств и генерацию.

Почему первого вызова Qdrant обычно было достаточно

Плотный поиск хорошо справлялся с семантическим сходством. Minima добавила BM25 для восстановления имен, идентификаторов и строк версий, которые могут быть пропущены эмбеддингами. Qdrant объединил два набора результатов с помощью взаимного рангового слияния (RRF), а затем переранжировал шорт-лист с помощью позднего взаимодействия на уровне токенов. Фильтры полезной нагрузки применяли ограничения по арендатору, языку, типу документа и версии во время запроса.

Приведенные ниже цифры охватывают поиск и цикл работы агента. Recall@10 и nDCG@10 используют один и тот же список оценки из 10 лучших результатов. Промпт агента был усечен до указанного бюджета контекста: 16 лучших для плотного поиска или 8 лучших для гибридного. «Доказательств первого прохода достаточно» означает, что агент не вызывал дополнительный второй поиск. Задержка на вызов — это время запроса к прогретому Qdrant с предварительно вычисленными векторами запросов.

Время запроса p95 для Qdrant составило 43,2 миллисекунды, что составляет менее 0,3% от 20,8-секундного эпизода агента p95 BF16. Первый поиск был достаточным в 87% задач, а средний контекст сократился с 5,2 тыс. до 2,3 тыс. токенов. Еще до включения Minima медианная задержка выполнения задачи снизилась с 21,3 до 14,6 секунд, а успешная пропускная способность выросла с 1081 до 1669 задач на GPU-час, что составляет прирост 54%.

«Внутри цикла агента слабый первый поиск стоит дороже, чем один дополнительный поиск. Он запускает еще один раунд планирования, поиска и вывода, поэтому получение достаточных доказательств с первого прохода — один из самых простых способов сделать всю систему быстрее и эффективнее». — Сергей Козырев, соучредитель и генеральный директор Minima AI

«Внутри цикла агента слабый первый поиск стоит дороже, чем один дополнительный поиск. Он запускает еще один раунд планирования, поиска и вывода, поэтому получение достаточных доказательств с первого прохода — один из самых простых способов сделать всю систему быстрее и эффективнее». — Сергей Козырев, соучредитель и генеральный директор Minima AI

Как Minima ускорила каждый вызов модели

Minima хранила веса Qwen3.6-27B в формате NVFP4 W4A4 и запускала их с помощью нативных ядер Blackwell. Недавние и опорные KV оставались в FP8. Устаревшие страницы перемещались на уровень TQ3 с 3-битным сжатием. Minima отключила квантование векторов Qdrant, чтобы эффекты поиска и вывода LLM оставались раздельными.

Сжатие сохранило качество задач. При фиксированном поиске Qdrant успешность выполнения задач с опорой на данные составила 84,3% для BF16 и 84,2% для Minima, F1 цитирования — 90,8% и 90,7%, а корректные вызовы инструментов — 99,8% для обоих случаев. Дельта качества парных задач составила -0,1 процентного пункта (95% ДИ [-0,7, +0,5]), что прошло предварительно зарегистрированный порог нехудшего качества.

Совместный результат: в 2,92 раза больше успешных задач на GPU

При неизменном BF16, Qdrant увеличил чистую емкость с 1350 до 1980 задач на GPU-час. При фиксированном Qdrant, Minima увеличила этот показатель до 3750. Применение коэффициента успешности выполнения задач дает 3158 успешных задач на GPU-час, что в 2,92 раза больше базового уровня.

В таблице ниже представлены результаты работы агента при параллелизме 8, с ограничением финальных ответов в 256 токенов. Скорость выполнения задач — это количество завершенных задач в реальном времени на GPU-час.

При ставке 1,50 доллара США за GPU-час, которую Minima использовала для учета затрат, стоимость GPU на 1000 успешных агентских задач снизилась с 1,39 до 0,48 доллара США, что составляет сокращение на 65%. Это сравнение только для GPU исключает хост Qdrant и сервисы эмбеддингов. Те же выделенные сервисы оставались онлайн во всех трех условиях, хотя гибридный конвейер увеличил нагрузку на них.

Minima не стала умножать 3,2-кратное сжатие весов, 3,5-кратное сжатие KV и меньший контекст поиска в единое системное утверждение. Они влияют на разные «узкие места». Измеренные сквозные результаты показали 2,78-кратное увеличение емкости по количеству задач и 2,92-кратное увеличение количества успешных задач на GPU-час.

Почему это важно для агентского RAG

Qdrant и Minima решают проблему различных затрат внутри цикла. Qdrant сделал первый поиск более эффективным в большинстве случаев и сократил объем данных, передаваемых модели при каждой попытке. Minima снизила затраты памяти и вычислительных мощностей на планирование, проверку и ответы.

Производительность агентской системы ограничена всем процессом выполнения, а не только векторным поиском или пропускной способностью модели в отдельности. В этом тесте Qdrant улучшил качество данных, передаваемых модели, а Minima увеличила объем вывода, который может обслуживать один графический процессор. Вместе они обеспечили выполнение в 2,92 раза большего количества успешных задач без снижения валидности вызовов инструментов, обоснованности качества или качества цитирования.

Воспроизведите это на своем корпусе данных

Если вы используете агентский RAG на Qdrant, Qdrant и Minima готовы помочь воспроизвести этот бенчмарк на вашем корпусе данных и агентском цикле. Свяжитесь с Qdrant или свяжитесь с Minima, чтобы начать.

Технические ссылки

Руководство Qdrant по агентскому векторному поиску объясняет, почему задержка поиска, память, фильтрация и переранжирование важны в многошаговых рабочих процессах агентов.

Учебное пособие по агентскому RAG с использованием LangGraph и Qdrant охватывает выбор инструментов, повторный поиск и управление состоянием потока выполнения агента.

Документация Qdrant по гибридным и многоэтапным запросам описывает плотную и разреженную предварительную выборку, слияние RRF и DBSF, а также многоэтапное ранжирование.

Учебное пособие Qdrant по гибридному поиску с переранжированием описывает рабочий процесс с использованием плотных, разреженных векторов и позднего взаимодействия в стиле ColBERT.

Учебное пособие Qdrant по мультивекторам и позднему взаимодействию охватывает нативные мультивекторные представления и оценку MaxSim.

Документация Qdrant по фильтрации описывает условия для полезной нагрузки и идентификаторов точек для ограничений, определенных приложением.

NVIDIA RTX PRO 6000 Blackwell product page содержит информацию о 96 ГБ памяти GDDR7 и поддержке Blackwell FP4.

Сайт Minima охватывает оптимизацию весов моделей, KV-кэша и обслуживания.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
У Automattic появился новый совет директоров после неудачной попытки отправить генерального директора в отпускПресса
Automattic

У Automattic появился новый совет директоров после неудачной попытки отправить генерального директора в отпуск

Новый навык обнаруживает риски ИИ-агентов, устраняет их и доказывает эффективность исправлений
Microsoft

Новый навык обнаруживает риски ИИ-агентов, устраняет их и доказывает эффективность исправлений

Некоторые клиенты Supabase открывают в публичном доступе огромные массивы личных данных пользователей
Пресса
Supabase

Некоторые клиенты Supabase открывают в публичном доступе огромные массивы личных данных пользователей

Основы Blazor: SEO для веб-приложений на Blazor
Telerik

Основы Blazor: SEO для веб-приложений на Blazor

Вас затронули сокращения? Не упустите возможность приобрести пропуск Expo+ на TechCrunch Disrupt 2026 всего за 75 долларовПресса
Expo

Вас затронули сокращения? Не упустите возможность приобрести пропуск Expo+ на TechCrunch Disrupt 2026 всего за 75 долларов

Последние 24 часа, чтобы сэкономить до 200 долларов на TechCrunch Disrupt 2026. Причина 5 из 5 для участия: ИмпульсПресса
Momentum

Последние 24 часа, чтобы сэкономить до 200 долларов на TechCrunch Disrupt 2026. Причина 5 из 5 для участия: Импульс

Ещё от Qdrant

SHIFT: смена языков в многоязычном RAG
Qdrant

SHIFT: смена языков в многоязычном RAG

Хватит плохих бенчмарков: инструменты для исследований промышленного уровня
Qdrant

Хватит плохих бенчмарков: инструменты для исследований промышленного уровня

Как настроить векторный поиск без гаданий
Qdrant

Как настроить векторный поиск без гаданий

Как Bayer создала корпоративную поисковую систему с помощью Qdrant
Qdrant

Как Bayer создала корпоративную поисковую систему с помощью Qdrant