Поделиться в MAX

Qwen 3.8 27B локально на двух RTX 5070 Ti: 262к контекста и Claude Code без облака

Qwen 3.8 27B локально на двух RTX 5070 Ti: пять конфигураций vLLM, максимальный контекст 262 144 токена и подключение модели к Claude Code. Тестирую не облако и не серверные H100, а сборку, которую реально собрать дома: Ryzen 5 3600, две RTX 5070 Ti по PCIe 4.0 x8 и RTX 3090 в нижнем слоте через чипсет. Мой бенчмарк меряет железо и инференс, а не качество самой модели: скорость чтения запроса (префилл), подтверждённый контекст через поиск иголки в стоге сена на 10, 50 и 90 процентах длины, падение скорости на длинном промпте, исправность сборки после агрессивного квантования кэша и агентская траектория на 26 ходов. Все команды запуска, чат-шаблон и таблицы с замерами лежат в статье по ссылке выше. Что получилось по конфигурациям: 262 144 токена контекста ценой скорости, 65 536 токенов с моделью целиком и живым vision, MTP со спекулятивным декодированием и приростом скорости 82 процента, 170 912 токенов без сжатия кэша и вариант с третьей картой на llama.cpp. Отдельно показываю, почему turbo quant 4 бита вместе с MTP пока даёт мусор, сколько стоит ответ в строгом JSON-формате и где у vLLM поздно включается кэш префикса. В видео: - железо стенда и почему PCIe x4 через чипсет портит картину - сводная таблица: 5 конфигураций, 6 прогонов - префилл и подтверждённый контекст: как я проверяю, что контекст реально работает - MTP: где даёт плюс 82 процента, а где ломает генерацию по схеме - NVFP4 от Unsloth против FP8 и Q4 в llama.cpp - vLLM против llama.cpp на трёх видеокартах...

0/0


0/0

0/0

0/0

0/0