Протягом останніх кількох місяців я намагався запустити локальні LLM на кількох серверах, від повноцінних карт RTX, блоків NAS і старих ігрових ПК до випадкових ноутбуків і плат Raspberry Pi. Нікого не дивує, що мені найбільше пощастило з картами Nvidia, а не лише з сучасними картами з ядрами Tensor. Насправді я зараз використовую старішу GTX 1080 для запуску Gemma-4-E4B для моїх повсякденних додатків продуктивності, і ця гігантська карта може навіть керувати подібними GPT-OSS-20B і Gemma-4-26B-A4B на пристойній швидкості, якщо я покладаюся на завантаження віртуальної машини.
Однак у мене все ще є Intel Arc A750, який я купив на розпродажі давно, і я використовую його лише тоді, коли мені потрібен відеовихід для іншого старого пристрою. Тож я подумав, що можу зробити якийсь LLM як проект на вихідних. Чесно кажучи, я не очікував від цього застарілого GPU. І хоча я б не сказав, що він може впоратися з усіма моїми завданнями так само добре, як моя GTX 1080, цього більш ніж достатньо для моїх завдань із висновків Gemma-4-E4B.
Налаштування llama.cpp для мого Intel Arc A750 було справжньою справою
І те саме стосується передачі графічного процесора моєму llama.cpp LXC
Оскільки я хотів мінімального втручання від основної платформи для хостингу LLM, я вирішив використовувати llama.cpp замість Ollama та інших механізмів висновків. Крім того, Windows 11 була жахливим вибором для цього експерименту через її роздутий характер, тому я вирішив вибрати інший Proxmox llama.cpp на основі LXC. Оскільки єдиним домашнім сервером резервного копіювання, який може запускати Proxmox і підтримувати виділений графічний процесор у моєму арсеналі, є стара машина з двома ЦП Xeon 2650 v4 разом із 64 ГБ пам’яті DDR4 ECC, я використав її як піддослідну свинку для цього тесту.
Дивно, але підключення Arc A750 до цього пристрою призвело до того, що Proxmox виявив картку – це велика відмінність у порівнянні з моїм досвідом роботи з GTX 1080. Однак я вручну оновив драйвери Vulkan на своєму хості, запустивши. apt install -y mesa-vulkan-drivers vulkan-tools libvulkan1. Оскільки я хотів побачити, наскільки добре буде автоматичне перемикання GPU з моєю картою Arc, я запустив його bash -c “$(curl -fsSL він наказав і вибрав так на сторінці перемикання GPU.
Невдовзі майстер інсталяції почав працювати, і за кілька хвилин мій Debian LXC був повністю функціональним із перемиканням GPU. Після повторення процесу встановлення драйвера в цьому контейнері я закінчив apt install glslc glslang-tools libvulkan1 vulkan-tools libvulkan-dev spirv-tools spirv-headers build-essential git cmake curl libxext6 команду для отримання всіх залежностей, необхідних для встановлення мого llama.cpp.
Просто щоб повторно перевірити пропускну здатність графічного процесора LXC, який я використовував інформація про вулкан | grep -i Назва пристроюі, звичайно, Vulcan Arc визначив би мій A750 як єдиний сумісний пристрій. Так я і зробив git клон намалювати підсумкові файли двигуна та cd llama.cpp щоб перейти до його папки. Оскільки я планував використовувати старий добрий Vulcan для керування llama.cpp, cmake -B make -DGGML_VULKAN=ON і cmake –build build –config Форма -j$(nproc) були єдиними командами, які мені були потрібні для компіляції llama.cpp.
Мій дешевий графічний процесор може працювати з Gemma-4-E4B на високій швидкості
Arc A750 трохи повільніший за мій GTX 1080, але в будь-якому випадку непоганий
Оскільки Gemma-4-E4B — це модель, на яку я найбільше покладаюся в своїх локальних завданнях логічного висновку, це перша модель, яку я хотів протестувати з Intel Arc A750. Після того, як я перемістив і Gemma 4 E4B, і файл MMPROJ до каталогу /root/models, я почав працювати. ./llama-server -m “/root/models/gemma-4-E4B-it-Q4_K_M.gguf” –mmproj “/root/models/mmproj-gemma-4-E4B-it-BF16.gguf” -c 100000 –host 0.0.0908 –port . всередині /root/llama.cpp/build/bin. Потім я запустив веб-інтерфейс llama-server і звернувся до LLM.
Дивно, але Intel Arc A750 зміг запустити Gemma-4-E4B із середньою швидкістю 33 токени/с, а іноді трохи нижче до 28 т/с. Це приблизно на 4-6 токенів/с менше, ніж у моєї GTX 1080, що дивно, враховуючи, що я очікував, що ця стара карта Arc працюватиме добре нижче позначки 15 т/с. Я також спробував кинути зображення, аудіозаписи та великі вкладки в цю установку, і вона з легкістю впоралася з усім, що я кинув. На жаль, коли я кинув мої моделі експертних сумішей у бій, усе пішло на гірше…
Змішані експертні моделі – це окрема історія
Вони, звичайно, працюють із завантаженням віртуальної машини, але їх продуктивність далеко не вражаюча
Моделі віртуальних машин стали важливою частиною локального набору LLM, оскільки я можу завантажити певних експертів у ЦП і системну пам’ять, щоб зменшити обмеження VRAM на моїх старих відеокартах. Це майже те, що мій GTX 1080, графічний процесор із лише 8 ГБ відеопам’яті, може працювати як Gemma-4-26B-A4B зі швидкістю 14+ токенів/секунду.
На жаль, завантаження віртуальної машини не дало серйозного прискорення моєму Intel Arc A750. Коли я спробував запустити Gemma-4-26B-A4B із 30 шарами, завантаженими на ЦП, Arc A750 міг генерувати лише 3,5 жетона на секунду. Звичайно, якщо я запускаю його у фоновому режимі, він не стане повністю непридатним для використання. Але враховуючи продуктивність графічного процесора з навантаженням Gemma-4-E4B, я повинен визнати, що я був дуже розчарований тим, наскільки жахливо працювала модель віртуальної машини.
Зменшення рівня віртуальної машини до 20 спричинило поломку llama.cpp, тоді як зменшення його до 25 і зменшення контекстного вікна до 10 000 піктограм дало ті самі результати. Я навіть спробував перейти на GPT-OSS-20B, але швидкість генерації токенів залишилася такою ж. Я натрапив на кілька тем на GitHub про те, що графічні процесори Intel жахливо працюють із прапорцями завантаження віртуальної машини, тому це може бути просто помилка з llama.cpp. У будь-якому випадку, мій Arc A750 недостатньо потужний, щоб керувати великими експертними моделями.
Проте я вважаю цей досвід вдалим
Незважаючи на жахливу продуктивність GPU з MoE LLM, я повинен сказати, що Arc A750 можна використовувати для розміщення локальних моделей ШІ. Звичайно, я б не зробив усе можливе, щоб купити графічний процесор Arc лише для того, щоб запускати на ньому свої LLM. Але оскільки я вже маю один у своєму арсеналі, я можу просто використовувати його для управління Gemma-4-E4B і дозволити моїй GTX 1080 зосередитися на розміщенні GPT-OSS-20B.