Vulkan на GTX 1080 генерирует в полтора раза быстрее CUDA.
Автор делает программу для локальных нейросетей, где всё настраивается само, без Python и терминала. Он
пишет, что
Qwen вставляет китайские слова в русский текст даже при температуре 0.
В описании также упоминается случай с маленькой моделью, но детали обрываются.
Программа автора как раз показывает: для локальных нейросетей CUDA не обязательна.