qwen3.5:4b-q4_K_M вече отговаря на въпроси изцяло офлайн на обикновен лаптоп с 16 GB памет. Познаваш го от втората част на поредицата: надежден помощник е за общи задачи. Но не е моделът, на който да повериш и търсенето във файловете си, и програмирането. Ако разчиташ един изтеглен модел да върши всичко, ще искаш твърде много от него. По-добре е да имаш три малки модела, всеки полезен за своята задача.
За да държиш локалната си AI среда под контрол, трябва сам да решиш кой модел и коя програма да използваш, какъв лиценз важи и къде остават данните ти. Ако още не си проверил RAM или VRAM на лаптопа си, започни с колко памет му трябва за локален AI. Ако не си инсталирал Ollama, виж как да настроиш първия си локален AI доставчик. Тук приемаме, че и двете вече са готови. Остава да избереш моделите и да провериш кои вършат работа.
За полезен набор от локални AI модели ти трябват решения за три различни задачи, а не един модел, от който да очакваш всичко.
Помощник за общи задачи като разговор, писане на чернови и бързи въпроси: qwen3.5:4b-q4_K_M. Файлът за изтегляне е 3,4 GB, а тагът е същият като във втората част.
Компактен специализиран модел за по-тясна задача, например отговор в зададен формат или разсъждение при конкретни ограничения: granite4.2:3b. Файлът за изтегляне е 2,2 GB, лицензът е Apache 2.0, а моделът излиза през август 2026 г. В раздел 6 ще намериш и други специализирани варианти за програмиране, математика, работа с изображения и превод. Така можеш да избереш модел според своята задача.
Модел за векторни представяния за търсене в собствените ти документи: embeddinggemma:300m, с файл за изтегляне от 622 MB. Той не води разговор. Превръща текста във вектори, в които приложение може да търси. Процесът е описан подробно в раздел 8.
Трите файла за изтегляне заемат общо около 6,2 GB на диска. Това не означава, че ще заемат общо толкова памет, когато работят: ако заредиш и трите едновременно, свободната памет на лаптопа пак може да не стигне. Зареждай по един модел за конкретната задача, проверявай го в реална работа и премахвай онези, които не са ти полезни.
Ефектът от квантизацията се вижда най-ясно, когато сравниш варианти на един и същ модел. В каталога на Ollama qwen3.5:9b-q4_K_M е 6,6 GB, qwen3.5:9b-q8_0 е 11 GB, а qwen3.5:9b-bf16 е 19 GB. Теглата са едни и същи, но точността и размерът на файловете за изтегляне се различават.
Посочените размери са на файловете в каталога, а не гаранция за това колко памет ще заемат моделите след зареждане. По-ниската точност намалява размера на файла, а често и нужната памет при работа. Дали качеството на отговорите ще пострада, зависи от модела, начина на квантизация и задачата. Не приемай предварително нито че разлика няма да има, нито че по-малкият размер е без компромис.
Освен за заредените тегла е нужна памет и за контекстния прозорец, неговия кеш за ключове и стойности и останалите работещи програми. Дори квантизацията да освободи памет, това само по себе си не гарантира, че ще побереш по-голям модел. Просто е по-разумно да опиташ така, отколкото да започнеш с файл с пълна точност.
Две означения в каталога лесно могат да те подведат при избора на файл за изтегляне.
Първият капан. В описанието на самия модел Google нарича Gemma 4 E2B модел с 2,3 млрд. „ефективни“ езикови параметъра. Това звучи като малък файл. Изтеглянето през Ollama обаче е 7,2 GB, почти колкото Q4 варианта на gemma4:12b с неговите 7,6 GB. Когато преценяваш какво може да побере лаптопът ти, гледай размера на файла за изтегляне, а не броя параметри.
Вторият капан. Таг без уточнение може незабелязано да избере друг модел. Ако изтеглиш само granite4.2, ще получиш модела с 8 млрд. параметъра и размер 5,3 GB, а не варианта с 3 млрд. параметъра и размер 2,2 GB от раздел 2. Ако изтеглиш само qwen3-embedding, ще получиш модела с 8 млрд. параметъра и размер 4,7 GB, а не варианта с 0,6 млрд. параметъра и размер 639 MB от раздел 8.
И в двата случая постъпвай еднакво: използвай пълния, точно указан таг, а не само името на семейството. Провери и размера на изтегления файл, преди да приемеш, че си получил варианта, който искаш да тестваш.
Максимум от 128K или 256K токена в каталога показва какъв контекст моделът по принцип може да приеме. Това не означава, че лаптоп с 16 GB памет непременно ще се справи с него.
По подразбиране Ollama задава контекст от 4096 токена. Можеш да го увеличиш, но нужната памет расте както с дължината на контекста, така и с броя едновременни заявки. Настройката num_ctx: 4096 от втората част на поредицата съвпада именно с тази предпазлива стойност по подразбиране. Числото не е избрано произволно.
Започни тестовете на нов модел с контекст от 4K до 8K токена и само една активна сесия. Следи използваната системна памет и увеличавай контекста едва след като се увериш, че работата остава стабилна, а не само защото каталогът посочва по-висок технически максимум.
Няма един специализиран модел, който да е най-добър за всички случаи. Има конкретна задача пред теб и няколко малки модела, които си струва да изпробваш с нея.
Програмиране: qwen2.5-coder:3b (1,9 GB) или по-големият qwen2.5-coder:7b (4,7 GB). И двата са с лиценз Apache 2.0.
Математика или логика при зададени ограничения: phi4-mini:3.8b (2,5 GB) от Microsoft.
Въпроси по изображения и екранни снимки: gemma4:e2b (7,2 GB) или gemma4:12b Q4 (7,6 GB). И двата са с лиценз Apache 2.0, а в описанията им е посочено, че приемат текст и изображения.
Писане на различни езици или превод: aya-expanse:8b (5,1 GB), създаден за 23 езика.
Важно е да обърнеш внимание на лиценза: Aya Expanse 8B е с лиценз CC-BY-NC-4.0, допълнителни условия и ограничение до нетърговска употреба. Не го избирай по подразбиране, сякаш за него важат същите условия като за моделите с лиценз Apache по-горе. Ако нито една от четирите задачи не е твоята, granite4.2:3b от раздел 2 остава изборът за разсъждение с общо предназначение.
Провери всеки модел със собствената си задача, преди да се спреш на него. Специализираният модел си заслужава мястото, ако помага с работата, която му възлагаш, а не защото оглавява чужда класация.
Пет кратки теста ще ти кажат повече за един модел от страницата му в каталога. Използвай собствен материал и повтори едни и същи пет задачи с всеки модел, който обмисляш.
1. Резюме с опора в текста. Дай на модела бележка от 250 думи и поискай три конкретни действия. За всяко от тях той трябва да посочи изречението, на което се основава. Отбележи всяко твърдение без опора в текста.
2. Извличане в зададен формат. Измисли пет уговорени срещи с имена и дати. Поискай JSON точно с полетата, които си посочил, а после свери и петте записа с написаното от теб.
3. Поправка на код. Дай на модела една кратка функция, която не работи правилно, и един тест. Запиши дали тестът минава след поправката. Използвай едно и също хранилище и един и същ контекст за всеки модел, който сравняваш.
4. Превод между два езика. Нека човек, който владее добре езика, провери дали след превода един реалистичен абзац е запазил имената, числата и нюансите си. Не оценявай многоезичните възможности само по задача, формулирана на английски.
5. Въпрос по изображение, само за модели, които работят с изображения. Покажи диаграма или екранна снимка с проверим отговор и се увери, че си изпратил самото изображение, а не само името на файла.
При всеки тест записвай дали отговорът съвпада с този, който знаеш за верен, дали моделът е спазил инструкциите и какво е измислил. Отбелязвай също времето до първия видим резултат, общото време, броя токени и дали моделът е работил на CPU или GPU. Оценявай полезността и скоростта поотделно: модел, който разсъждава преди отговора, може да изразходва време за токени, които изобщо не виждаш.
Моделът за векторни представяния от раздел 2 има една задача: да превръща текста във вектори, в които приложение може да търси. Сам по себе си той не отговаря на въпроси.
Последователността е важна. Първо файловете ти се разделят на откъси, после моделът превръща всеки откъс във вектор, а локално хранилище запазва векторите. Въпросът ти също се превръща във вектор. Приложението намира най-близките откъси и чак тогава моделът за разговор отговаря въз основа на тях, като ги цитира.
Моделът за разговор не е обучен върху твоите документи. Когато зададеш въпрос, той вижда само откъсите, които получи от стъпката за търсене.
Можеш да провериш как работи това с малък пример и без сложна подготовка: индексирай пет бележки, които вече имаш. Задай един въпрос, чийто отговор се намира в една от тях, и втори, на който няма отговор в нито една. При работеща настройка за първия въпрос приложението намира правилния откъс, а моделът го цитира в отговора си. За втория моделът трябва да признае, че няма информация, на която да се опре, вместо да си измисля отговор. Проверявай отделно намерения откъс и крайния отговор.
Преди изтегляне провери дали си посочил пълния таг embeddinggemma:300m или qwen3-embedding:0.6b. Причината е същата като при таговете без уточнение в раздел 4.
Модел с означение като „26B A4B“ използва само част от параметрите си при генерирането на всеки токен. Пълният му набор от 26 млрд. тегла обаче пак трябва да се съхранява някъде или да се зарежда поточно. По-малко активни параметри не означават нито по-малък файл, нито непременно по-малко заета памет при работа.
В този набор няма новоизмерени резултати от тестове за производителност. Ако срещнеш число от друг източник, например съобщените от един човек около 18,5 токена в секунда при нетипична конфигурация с 26B модел от типа смес от експерти, по-стар CPU и GPU с 6 GB памет, приемай го за резултат само от неговата конфигурация. То не е общо очакване за всеки модел с такова означение.
Изпробвахме този набор на два лаптопа, които се използват и днес: същите два от втората част на поредицата. Единият е базов модел с Apple Silicon, а другият е мобилна работна станция с Windows и собствена видеопамет. И двата са реновирани (професионално проверени, почистени и възстановени) и се предлагат в refurbed с 12-месечна гаранция. Всеки от тях разполага с достатъчно памет за изброените по-горе модели, когато са заредени поотделно.
13-инчовият MacBook Air (2026) с чип M5 стандартно е с 16 GB обединена памет и може да се конфигурира с до 32 GB. Dell Precision 7730 съчетава 32 GB системна памет с отделни 6 GB видеопамет NVIDIA. Това са два различни ресурса, а не една обща стойност.
Не ги представяме, за да те убеждаваме да купиш някой от тях. С тези лаптопи проверихме написаното тук, за да можеш да сравниш своя с реални конфигурации, а не само с таблица с характеристики от реклама.
Лицензът важи за конкретния модел, не за цялото му семейство. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B и Gemma 4 E2B са с лиценз Apache 2.0. За Aya Expanse 8B важи лицензът CC-BY-NC-4.0 с допълнителни условия, само за нетърговска употреба, както отбелязахме в раздел 6. Възможността да изтеглиш теглата, разрешението на носителя на авторските права да ги използваш и „притежаването“ на самия модел са три различни неща. Проверявай актуалната страница на конкретния модел, който изтегляш, а не само страницата на семейството му.
За да остане наборът ти компактен, преглеждай го редовно. С ollama rm премахваш изтеглен модел, който не ти върши работа. Когато разбереш, че няма да използваш Aya Expanse, изпълни например ollama rm aya-expanse:8b. С ollama ls виждаш кои модели са на диска, а с ollama ps проверяваш кои са заредени в паметта. Каталозите се променят, затова преразглеждай избора си, вместо да разчиташ на решение отпреди месеци.
Дори малък модел може да измисли откъс, да пропусне нюанс на друг език или да напише код, който изглежда правилен, но не минава теста. Изпробвай сам всяка препоръка тук. Когато става дума за нещо важно, тя не замества експертната проверка.
Мога ли да пусна и трите модела едновременно? Вероятно не, поне не без затруднения на лаптоп с 16 GB памет. Зареждай по един модел за текущата задача и го сменяй при нужда, вместо да държиш помощника за общи задачи, специализирания модел и модела за векторни представяния едновременно в паметта.
Нужен ли ми е GPU за модела за векторни представяния? Не. embeddinggemma:300m е достатъчно малък, за да го пробваш само на CPU, но измери колко време отнема работата му, вместо да очакваш мигновен резултат.
По-големият модел винаги ли дава по-добър отговор? Не. Дали модел с 4B или с 9B параметъра ще се представи по-добре, зависи от задачата. Затова в раздел 7 има метод с пет теста, а не само едно число от класация.
Достатъчен ли е вариантът Q4? Зависи от задачата. Сравни тага Q4 със съответния Q8 вариант на същия модел в три свои теста, ако имаш достатъчно памет да пуснеш и двата, както е описано в раздел 3.
Мога ли да използвам Aya Expanse за търговски проект? Не по подразбиране. Лицензът CC-BY-NC-4.0 е за нетърговска употреба и има допълнителни условия. Провери актуалната страница на модела, преди да приемеш друго.
Нужен ли е интернет на модела за векторни представяния, след като го изтегля? Не. Както останалите модели в този набор, той работи офлайн, щом теглата му са на диска.
Инсталирай 4B помощника и един специализиран модел за своя задача на лаптопа, за който прецени нужната памет с помощта на първата част и настрои локалната среда с втората. Направи своя версия на теста от раздел 7 с три въпроса. Запази модела, който ти помага, а другия премахни с ollama rm. Мисли за покупка на повече памет едва когато реална задача, а не таблица с характеристики, покаже, че точно паметта те ограничава.
С това приключва поредицата от три части. Ако се окаже, че лаптопът ти първо се нуждае от повече памет, категорията с лаптопи е подходящо място, откъдето да започнеш.
Абонирайте се за нашия бюлетин за първи път и спестете 15 €!
Никога повече не пропускайте оферта.
Информация за използването на лични данни може да бъде намерена в нашата Политика за поверителност.
Потвърдете регистрацията
Почти готово: Изпратихме ви имейл за потвърждение