Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Kak zapustit deepseek r1 0528 lokalno 2
Dev48

© 2026 · All rights reserved.

Как запустить Deepseek-R1-0528 локально

Источник: Unsloth - Train and Run Models Locally

Как запустить Deepseek-R1-0528 локально

Источник: Unsloth - Train and Run Models Locally

Модель R1-0528 от DeepSeek — самая мощная модель с открытым исходным кодом. Узнайте, как запустить эту модель и дистиллированную версию Qwen3-8B с помощью динамического квантования Unsloth 1.78-bit.

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Запуск динамических 1-битных GGUF-моделей DeepSeek-R1-0528

29 мая 2025 г. • Авторы: Daniel и Michael

29 мая 2025 г.

Авторы: Daniel и Michael

DeepSeek-R1-0528 — это новое обновление модели рассуждений R1 от DeepSeek. R1-0528 является самой мощной в мире моделью с открытым исходным кодом, конкурирующей с GPT-4.5 и o3 от OpenAI, а также с Gemini 2.5 Pro от Google.

Компания DeepSeek также выпустила дистиллированную версию R1-0528, дообучив модель Qwen3 (8B). Эта дистиллированная версия достигает той же производительности, что и Qwen3 (235B). Qwen3 GGUF: Вы также можете дообучить модель Qwen3 с помощью Unsloth.

Вы можете запустить модель, используя 1,78-битные динамические GGUF-модели 2.0 от Unsloth в ваших любимых фреймворках для инференса. Мы квантовали модель DeepSeek R1 с 671 млрд параметров, уменьшив её размер с 720 ГБ до 185 ГБ — это сокращение объема на 75%.

Рекомендуется: Прочитайте наше полное руководство, чтобы узнать, как запустить DeepSeek-R1-0528 локально.

Чтобы обеспечить наилучший баланс между точностью и размером, мы не квантуем все слои, а выборочно квантуем, например, слои MoE до меньшего количества бит, оставляя слои внимания и другие слои в 4 или 6 битах.

И получите наш полный набор моделей

🐋 Как запустить DeepSeek-R1-0528

Для DeepSeek-R1-0528-Qwen3-8B модель может поместиться практически в любую конфигурацию, даже в системы с 20 ГБ оперативной памяти. Никакой предварительной подготовки не требуется.

Qwen3 и полная модель R1-0528 используют одинаковые настройки и шаблоны чата.

Согласно DeepSeek, это рекомендуемые настройки для инференса R1 (для R1-0528 следует использовать те же параметры): - Установите температуру 0.6, чтобы уменьшить повторения и бессвязность. - Установите top_p на 0.95 (рекомендуется). - Проведите несколько тестов и усредните результаты для надежной оценки.

Рекомендуется иметь не менее 64 ГБ оперативной памяти для запуска этого квантования (вы получите 1 токен/с без GPU). Для оптимальной производительности вам потребуется не менее 180 ГБ объединенной памяти или 180 ГБ суммарной RAM+VRAM для скорости 5+ токенов/с. Хотя технически возможно запустить модель без GPU, мы не рекомендуем это делать, если только вы не используете чипы Apple с объединенной памятью.

Для 1,78-битного квантования: - На одном GPU с 24 ГБ видеопамяти (со всеми выгруженными слоями) вы можете ожидать пропускную способность до 20 токенов/секунду и около 4 токенов/секунду для инференса одного пользователя. - Постарайтесь обеспечить комбинацию RAM + VRAM, которая в сумме соответствует размеру загружаемого квантования (например, 183 ГБ = не менее 183 ГБ суммарной VRAM+RAM или объединенной памяти). - GPU с 24 ГБ, такой как RTX 4090, должен выдавать 3 токена/секунду, в зависимости от рабочей нагрузки и конфигурации.

🦙 Как запустить R1-0528-Qwen3-8B в Ollama:

  • Установите ollama, если вы еще этого не сделали! Вы можете запускать только модели размером до 32 млрд параметров. Чтобы запустить полную модель R1-0528 объемом 720 ГБ, смотрите здесь.
  • apt-get updateapt-get install pciutils -ycurl -fsSL https://ollama.com/install.sh | sh
  • Запустите модель! Обратите внимание, что вы можете вызвать ollama serve в другом терминале, если возникнет ошибка! Мы включили все наши исправления и предложенные параметры (температура и т.д.) в параметры нашей загрузки на Hugging Face!
  • ollama run hf.co/unsloth/DeepSeek-R1-0528-Qwen3-8B-GGUF:Q4_K_XL
  • Чтобы отключить «мышление» (thinking), используйте (или вы можете установить это в системном промпте):
  • >>> Напишите ваш промпт здесь

✨ Как запустить R1-0528 в llama.cpp:

  • Получите последнюю версию llama.cpp на GitHub здесь. Вы также можете следовать инструкциям по сборке ниже. Измените -DGGML_CUDA=ON на -DGGML_CUDA=OFF, если у вас нет GPU или вы хотите использовать только CPU для инференса.
  • apt-get updateapt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -ygit clone https://github.com/ggml-org/llama.cppcmake llama.cpp -B llama.cpp/build \ -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ONcmake --build llama.cpp/build --config Release -j --clean-first --target llama-quantize llama-cli llama-gguf-splitcp llama.cpp/build/bin/llama-* llama.cpp
  • Если вы хотите использовать llama.cpp напрямую для загрузки моделей, вы можете сделать следующее: (:IQ1_S) — это тип квантования. Вы также можете скачать через Hugging Face (пункт 3). Это похоже на ollama run. Используйте export LLAMA_CACHE="folder", чтобы заставить llama.cpp сохранять данные в определенное место.
  • export LLAMA_CACHE="unsloth/DeepSeek-R1-0528-GGUF"./llama.cpp/llama-cli \ -hf unsloth/DeepSeek-R1-0528-GGUF:IQ1_S \ --cache-type-k q4_0 \ --threads -1 \ --n-gpu-layers 99 \ --prio 3 \ --temp 0.6 \ --top_p 0.95 \ --min_p 0.01 \ --ctx-size 16384 \ --seed 3407 \ -ot ".ffn_.*_exps.=CPU"
  • Скачайте модель через (после установки pip install huggingface_hub hf_transfer). Вы можете выбрать UD-IQ1_S (динамическое 1,78-битное квантование) или другие квантованные версии, такие как Q4_K_M. Я рекомендую использовать наше 2,7-битное динамическое квантование UD-Q2_K_XL для баланса размера и точности.# !pip install huggingface_hub hf_transferimport osos.environ["HF_HUB_ENABLE_HF_TRANSFER"] = "0" # Иногда может ограничивать скорость, поэтому установите 0 для отключенияfrom huggingface_hub import snapshot_downloadsnapshot_download( repo_id = "unsloth/DeepSeek-R1-0528-GGUF", local_dir = "unsloth/DeepSeek-R1-0528-GGUF", allow_patterns = ["*UD-IQ1_S*"], # Динамическое 1-битное (185 ГБ) Используйте "*UD-Q2_K_XL*" для динамического 2-битного (251 ГБ))
  • Запустите тест Flappy Bird от Unsloth, как описано в нашем материале о 1,58-битном динамическом квантовании для DeepSeek R1.
  • Отредактируйте --threads 32 для количества потоков CPU, --ctx-size 16384 для длины контекста, --n-gpu-layers 2 для выгрузки слоев на GPU. Попробуйте настроить это, если вашему GPU не хватает памяти. Также удалите этот параметр, если у вас инференс только на CPU.
  • ./llama.cpp/llama-cli \ --model unsloth/DeepSeek-R1-0528-GGUF/UD-IQ1_S/DeepSeek-R1-0528-UD-IQ1_S-00001-of-00004.gguf \ --cache-type-k q4_0 \ --threads -1 \ --n-gpu-layers 99 \ --prio 3 \ --temp 0.6 \ --top_p 0.95 \ --min_p 0.01 \ --ctx-size 16384 \ --seed 3407 \ -ot ".ffn_.*_exps.=CPU" \ -no-cnv \ --prompt "<|User|>Создай игру Flappy Bird на Python. Ты должен включить следующее:\n1. Ты должен использовать pygame.\n2. Цвет фона должен быть выбран случайно и быть светлого оттенка. Начни со светло-голубого цвета.\n3. Многократное нажатие ПРОБЕЛА будет ускорять птицу.\n4. Форма птицы должна быть выбрана случайно: квадрат, круг или треугольник. Цвет должен быть выбран случайно из темных оттенков.\n5. Размести внизу землю, окрашенную в темно-коричневый или желтый цвет, выбранный случайно.\n6. Сделай счет, отображаемый в правом верхнем углу. Увеличивай его, если проходишь через трубы и не задеваешь их.\n7. Сделай случайно расставленные трубы с достаточным пространством. Раскрась их случайно в темно-зеленый, светло-коричневый или темно-серый оттенок.\n8. Когда проиграешь, покажи лучший результат. Сделай текст внутри экрана. Нажатие q или Esc завершит игру. Перезапуск осуществляется повторным нажатием ПРОБЕЛА.\nФинальная игра должна быть внутри раздела markdown на языке Python. Проверь свой код на наличие ошибок и исправь их перед финальным разделом markdown.<|Assistant|>"
  • Мы также тестируем наши динамические квантования с помощью теста Heptagon, который проверяет способность модели создавать базовый физический движок для симуляции вращающихся шаров внутри движущейся замкнутой семиугольной фигуры.

./llama.cpp/llama-cli \ --model unsloth/DeepSeek-R1-0528-GGUF/UD-IQ1_S/DeepSeek-R1-0528-UD-IQ1_S-00001-of-00004.gguf \ --cache-type-k q4_0 \ --threads -1 \ --n-gpu-layers 99 \ --prio 3 \ --temp 0.6 \ --top_p 0.95 \ --min_p 0.01 \ --ctx-size 16384 \ --seed 3407 \ -ot ".ffn_.*_exps.=CPU" \ -no-cnv \ --prompt "<|User|>Напиши программу на Python, которая отображает 20 шаров, отскакивающих внутри вращающегося семиугольника:\n- Все шары имеют одинаковый радиус.\n- На каждом шаре есть номер от 1 до 20.\n- В начале все шары падают из центра семиугольника.\n- Цвета: #f8b862, #f6ad49, #f39800, #f08300, #ec6d51, #ee7948, #ed6d3d, #ec6800, #ec6800, #ee7800, #eb6238, #ea5506, #ea5506, #eb6101, #e49e61, #e45e32, #e17b34, #dd7a56, #db8449, #d66a35\n- На шары должны влиять гравитация и трение, они должны реалистично отскакивать от вращающихся стен. Также должны происходить столкновения между шарами.\n- Материал всех шаров определяет, что высота их отскока при ударе не будет превышать радиус семиугольника, но будет выше радиуса шара.\n- Все шары вращаются с учетом трения, цифры на шарах можно использовать для индикации их вращения.\n- Семиугольник вращается вокруг своего центра со скоростью 360 градусов за 5 секунд.\n- Размер семиугольника должен быть достаточным, чтобы вместить все шары.\n- Не используй библиотеку pygame; реализуй алгоритмы обнаружения столкновений и реакцию на них самостоятельно. Разрешены следующие библиотеки Python: tkinter, math, numpy, dataclasses, typing, sys.\n- Весь код должен быть в одном файле Python.<|Assistant|>"

💕 Спасибо!

Благодарим за постоянную поддержку. Надеемся поделиться отличными новостями в ближайшие недели! 🙏

Как всегда, обязательно присоединяйтесь к нашей странице в Reddit и серверу Discord для получения помощи или просто чтобы выразить свою поддержку! Вы также можете следить за нами в Twitter и подписаться на новостную рассылку.

Спасибо за прочтение!

Дэниел и Майкл Хан 🦥 29 мая 2025 г.

← Все статьи

Ещё в разделе «Разработка ПО»

Все →
Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссовПресса
Momentum

Обзор Sennheiser Momentum 5: великолепный звук, невероятное время автономной работы и минимум компромиссов

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадкуПресса
Boeing

Boeing сообщает о программном сбое в 737 Max, затрагивающем некоторые функции автоматического захода на посадку

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch
Пресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Компании выбирают САПР от PTC для разработки и проектирования продуктов
PTC

Компании выбирают САПР от PTC для разработки и проектирования продуктов

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста
PTC

Clas Ohlson выбирает PTC FlexPLM для поддержки своей стратегии роста

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства
PTC

Canon ITS и PTC Japan запускают «Smart PLM Support Service» для поддержки трансформации рабочих процессов в сфере производства

Ещё от Unsloth AI

Тонкая настройка и запуск Gemma 3n с помощью Unsloth
Unsloth AI

Тонкая настройка и запуск Gemma 3n с помощью Unsloth

gpt-oss: дообучение с длинным контекстом
Unsloth AI

gpt-oss: дообучение с длинным контекстом

Среды обучения с подкреплением и способы их создания
Unsloth AI

Среды обучения с подкреплением и способы их создания

Как ускорить обучение LLM с помощью Unsloth и NVIDIA
Unsloth AI

Как ускорить обучение LLM с помощью Unsloth и NVIDIA

Тонкая настройка и запуск Gemma 3n с помощью Unsloth
Unsloth AI

Тонкая настройка и запуск Gemma 3n с помощью Unsloth