Поделиться в MAX

Запускаем Qwen 3.8 на RTX 2080, 3090, 4090. Локально.

Аватар автора
Галера Морева
4 дня активной работы с Qwen 3.8 — и я понял, что эта модель заслуживает отдельного большого ролика. Показываю ВСЕ варианты запуска на трёх физических серверах: 2×RTX 2080 (22 ГБ), 2×RTX 3090 и RTX 4090 (48 ГБ). GGUF через llama.cpp (Q4_K_M и Q8_0) и FP8 через vLLM. Замеряем скорость чтения и генерации, объём влезающего контекста и реальные цены на видеокарты — чтобы вы могли принять взвешенное решение, что покупать, а что нет. Спойлер: 2×3090 оказались круче, чем одна 4090 на 48 ГБ. И по чтению, и по генерации. А 2080 на FP8 через vLLM — это боль. Что в ролике: 🔹 Запуск Qwen 3.8 27B в кванте Q4_K_M на 2080 22GB — скорость и впечатления 🔹 Агентный вайб-кодинг: модель сама собирает цены с Авито и пилит лендинг 🔹 Q8_0 на 2×2080 и 2×3090 — до 60–80 токенов/сек на генерации кода 🔹 vLLM + FP8: почему на 2080 влезает всего 70К контекста (ответ в KV-кэше) 🔹 4090 48GB: 10 000 ток/сек на чтение — продакшн-уровень? 🔹 Полный контекст 260К на одной карте 🔹 Температуры, NVLink, охлаждение и другие радости локального инференса 🔹 Честный разговор: стоит ли вообще покупать железо или проще облачный провайдер Таймкоды: 00:00 Введение 00:58 План на ролик 03:46 Запуск на 2080 05:23 Подключяем pi.dev 10:58 Переходим на 3090 12:22 Чего я сделал на этой модели? 19:30 Делаем информационный лендос 25:20 Переходим к Q_8_0 26:35 Q_8_0 на 2x2080 37:50 Q_8_0 на 3090 40:18 Отступление про локальные модели 45:33 Q_8_0 на 4090 48 GB 49:55 Запуск в VLLM 52:02 VLLM 2x2080 57:22 VLLM на 4090 48GB 01:00:46...

0/0


0/0

0/0

0/0

0/0