Я перевіряю ці 4 цифри перед завантаженням локальної моделі ШІ, і піктограми мертві в останню секунду

Я перевіряю ці 4 цифри перед завантаженням локальної моделі ШІ, і піктограми мертві в останню секунду


Час від часу, коли новий набір відкритих ваг випадає для нової моделі, я поспішаю на сцену, щоб побачити, на що вона здатна. Нещодавно це сталося, коли Qwen3.8-27B прибув у серпні, і, ймовірно, це станеться знову, коли Alibaba або Google надішле щось, що приверне мою увагу.

Іноді мене засмучує те, що відбувається після завантаження. Я запускаю моделі на своїй RTX 4070 Ti Super, як очікувалося, але іноді моделі можуть повзати, просочуватися з відеопам’яті в системну пам’ять або іншим чином не погоджуватися з моєю машиною. Після того, як це сталося кілька разів, я склав уявний список цифр, на які потрібно звернутись перед масовим завантаженням.

Ось чотири цифри, які я читаю щоразу, і шкода, що я почав кілька місяців тому.

КВ-кеш

Обліковий запис пам’яті, який, здається, нікому не цікавий

Я перевіряю ці 4 цифри перед завантаженням локальної моделі ШІ, і піктограми мертві в останню секунду

Більшість нових місцевих ентузіастів штучного інтелекту просто дивляться на вагу моделі, перш ніж спробувати нову модель, як я робив більшу частину минулого року. Зрештою, якщо ваги відповідають VRAM, навіть якщо вони точно збігаються, модель має працювати, чи не так?

Ну, начебто. Проблема в тому, що вага — це не єдине, що з’їдає вашу VRAM. Існує також кеш KV, який є обліковим записом пам’яті моделі для всього, що ви тримаєте під час поточної розмови. На відміну від ваг, цей рахунок збільшується пропорційно контексту.

На моїй RTX 4070 Ti Super модель 14B у четвертому кварталі мала в середньому близько 7 ГБ пам’яті, що звучало досить добре, поки я не вирішив збільшити вікно контексту до 32 КБ. Кілька гігабайт можуть зникнути лише в кеші, і, можливо, навіть більше, якщо модель використовує повну багатошляховість замість групування запитів.

Модель завантажується, запускається, а потім, коли ви вставляєте довгий документ, швидкість візуалізації сповільнюється, оскільки це спричиняє витік відеопам’яті. Важливо врахувати ці накладні витрати та перевірити, якщо можливо, чи середовище виконання підтримує квантування кешу, оскільки відкидання кешу до Q8 зменшить вартість приблизно вдвічі.

Точна кількість

Чотири біти – це не число, це більше схоже на сім’ю

Сторінка Ollama для Qwen 3.8:27B. Авторство: Allama.

Однією з фраз, яку я часто бачив у місцевому ландшафті штучного інтелекту, на форумах і в субредітах загалом, є «квантова версія», у якій я завжди був одним із найменш освічених. Усі Q4_K_M, Q4_0 та IQ4_XS є 4-бітними, але вони відрізняються бітами за вагою, втратою удару та розміром.

Перехід із Q4 на Q8 подвоює заряд відеопам’яті за тих самих ваг. На моїй скромній карті на 16 ГБ це часто може звести нанівець різницю між моделлю 24B у Q4_K_M, що завантажується з достатнім простором для кешу KV, і тією самою моделлю Q8_0, яка ідеально відповідає та сканує.

Суфікс також несе інформацію, і я думаю, що для звичайного користувача він такий же важливий, як і число. K-кванти зберігають шари, найбільш чутливі до втрати точності, на більшій глибині та стискають решту, тому Q4_K_M поводиться краще, ніж плоский Q4_0 такого ж розміру. Саме з цієї причини я звик читати всю назву файлу, коли кажу про кількість.

Активні параметри

Скільки активних? Скільки їх на тарілці? Не те саме

Клод працює на M1 Mac із Gemma 4 на великому екрані позаду нього.

Довгий час після того, як вага впала, я вважав, що Gemma 4 E4B — це модель 4B. Це точно ні, і це було дуже незручно, коли я дізнався. Буква «E» в номенклатурі означає ефективний, а не активний, а E4B має близько 4,5 B ефективних параметрів разом із приблизно 8 B після врахування розміщення кожного шару. Саме ця прогалина змусила мене правильно прочитати мітки параметрів.

Змішані експертні моделі (ME) породжують таку ж плутанину, хоча й з протилежного напрямку. Якщо ви подивитеся на Qwen 30B-A3B, кожен сигнал маршрутизується через активні параметри близько 3B, тому він здатний виробляти зі швидкістю маленької моделі, тоді як усі ваги 30B все ще повинні десь жити.

Коли ви, як я, живете на 16 ГБ відеопам’яті, це дещо ускладнює роботу. Наприклад, модель віртуальної машини класу 30B у четвертому кварталі може отримати 16-18 ГБ перед кеш-пам’яттю, тому вона не буде на 100% резидентною у VRAM, хоча поводиться як модель 3B, коли йдеться про швидкість. Моделі віртуальних машин зазвичай мають кращу толерантність до навантаження на процесор, ніж компактні моделі, але все одно варто пам’ятати про активні параметри.

Контекст рідного навчання

Часто це потужне число

Побутовий контекст.

Інша річ, у якій я був винний у місцевих оглядах AI, це надто буквальне сприйняття довжини контексту. Якби в документації моделі було вказано, що вона підтримує 128K, я б припустив, що міг би написати про неї повний роман і очікувати, що вона запам’ятає все, що там було. Виявляється, «підтримується 128 КБ» і «навчається 128 КБ» означають різні речі. Багато з цих вікон отримано шляхом масштабування позиції обертання після попереднього навчання або їх розтягування за допомогою YaRN, тоді як сама модель тренується на чомусь набагато коротшому.

Мабуть, найцікавіша частина полягає в тому, що сама модель не виявляє жодних ознак несправності, коли ви штовхаєте її за початкову довжину. Це просто тихо, поступово погіршується, коли ви щось знаходите, і коли справа доходить до місцевих моделей, вони все одно так раді дати вам відповідь, що важко зрозуміти, чи відповідь звучить правильно. Немає сенсу витрачати VRAM на кеш-пам’ять розміром 128 КБ, якщо сама модель стає ненадійною приблизно на 32 КБ.

Кнопка завантаження з’явиться після того, як ви все це обчислите

Пам’ятаючи про ці чотири цифри та п’ять хвилин, можна значно заощадити пропускну здатність для будь-кого, хто новачок у місцевій сцені штучного інтелекту. Я вважаю, що багато з цих аспектів погано вивчені в більшості онлайн-посібників, де йдеться лише про початкове налаштування і нічого після цього, що часто може призвести до поганого досвіду для тих, хто працює з хмарними моделями.



Source link

Leave a Reply

Your email address will not be published. Required fields are marked *

Delta Air Lines (m1h262p) Delta Air Lines (m1h26g2) 애벗잡담잡이 애벗태양새 애벗얼가니새 애벗찌르레기 압드알쿠리참새 압딤황새 아버데어시스티콜라 이상한덤불개개비 에이버트북미덤불멧새 아비시니아캣버드 아비시니아크림슨윙 아비시니아지상코뿔새 아비시니아지상지빠귀 아비시니아긴발톱할미새 아비시니아올빼미 아비시니아파랑새 아비시니아낫부리후투티 아비시니아슬레이티딱새 아비시니아지빠귀 아비시니아왁스빌 아비시니아검은딱새 아비시니아동박새 아비시니아딱따구리 아카시아얼룩바벳 아카시아박새 아카디아딱새 아체직박구리 도토리딱따구리 아크레앤트슈라이크 아크레토디타이런트 아다마와멧비둘기 애들레이드솔새 아델리펭귄 애드미럴티매미새 아페프비둘기 아프간잡담잡이 아프간눈참새 아프리카줄무늬올빼미 아프리카검은오리 아프리카검은칼새 아프리카푸른딱새 아프리카푸른박새 아프리카넓적부리새 아프리카시트릴 아프리카목걸이멧비둘기 아프리카뜸부기 아프리카크림슨윙핀치 아프리카뻐꾸기 아프리카뻐꾸기매 아프리카뱀목가마우지 아프리카사막솔새 아프리카어두운색딱새 아프리카난쟁이물총새 아프리카에메랄드뻐꾸기 아프리카발가락물닭 아프리카파이어핀치 아프리카물수리 아프리카꾀꼬리 아프리카참매 아프리카풀올빼미 아프리카녹색비둘기 아프리카회색딱새 아프리카회색코뿔새 아프리카회색딱따구리 아프리카하리어매 아프리카매수리 아프리카산악잡담잡이 아프리카황조롱이 아프리카후투티 아프리카물꿩 아프리카습지하리어 아프리카올리브비둘기 아프리카대머리황새 아프리카검은머리물떼새 아프리카종려칼새 아프리카긴꼬리딱새 아프리카펭귄 아프리카피쿨렛 아프리카얼룩코뿔새 아프리카얼룩할미새 아프리카밭종다리 아프리카팔색조 아프리카난쟁이거위 아프리카난쟁이물총새 아프리카뜸부기 아프리카붉은눈직박구리 아프리카갈대개개비 아프리카강제비 아프리카바위 종다리류 아프리카성따오기 아프리카소쩍새 아프리카때까치딱새 아프리카은부리참새 아프리카제비물떼새 아프리카도요 아프리카저어새 아프리카점박이나무타기 아프리카검은딱새 아프리카뜸부기 아프리카지빠귀 아프리카볏도요 아프리카숲올빼미 아프리카노랑솔새 아가미왜가리 날렵한박새딱딱새