Изключваш лаптопа от интернет, задаваш въпрос и получаваш отговор. Без да променяш нищо, второ приложение на същия лаптоп получава отговор на абсолютно същия въпрос. Именно това превръща лаптопа, който вече ползваш, в малък личен AI сървър, към който могат да се обръщат и други приложения и скриптове.
Тук ще пуснеш изтеглен модел, няма да го обучаваш. Ако още не си проверил дали лаптопът ти има достатъчно RAM или VRAM, първо прочети колко RAM е нужна на лаптопа ти за локален AI. Ако вече знаеш, че машината ти покрива изискванията, продължи.
Всяка настройка за локален AI има четири отделни слоя. Ако знаеш ролята на всеки, ще ти е по-лесно да следваш стъпките по-долу.
Теглата на модела се изтеглят като файл, например квантизирана версия на малък модел с размер 3,4 GB. Това е размерът на файла на диска, а не гаранция, че при работа ще му стигнат 3,4 GB RAM.
Софтуерът за инференция зарежда тези тегла и отговаря на заявките. Тук ролята му изпълнява Ollama, която има собствен локален HTTP API. Благодарение на този слой и други приложения могат да се обръщат към лаптопа като към AI сървър.
Клиентската част изпраща заявките: това може да е вграденият чат на Ollama, кратък скрипт или отделно приложение. От избрания клиент зависи дали запитването ще остане на лаптопа, или ще бъде изпратено другаде.
Незадължителният индекс на документи позволява на модела за чат да търси в собствените ти файлове. Той използва отделен модел за векторно представяне и собствено място за съхранение. Индексът не се създава автоматично и не е тема на това ръководство.
Накратко: приложение или скрипт изпраща заявка до 127.0.0.1:11434, където я приема Ollama, която зарежда изтегления от теб модел. Ако изтриеш модела, запазената история на чата в клиентското приложение остава: двете се съхраняват на различни места.
Преди да инсталираш каквото и да е, отдели две минути и запиши колко RAM има лаптопът ти, какви са операционната му система и процесорът, дали има отделна видеопамет (VRAM) и колко свободно място има на SSD диска. За подробности относно RAM и VRAM виж колко RAM е нужна на лаптопа ти за локален AI.
Двата лаптопа по-долу се предлагат в момента в refurbed. И двата са реновирани: професионално тествани, почистени и възстановени, с 12-месечна гаранция. Единият е базов модел с Apple Silicon, а другият е лаптоп с Windows и отделна видеопамет. С който и да е от тях можеш да изпълниш всички стъпки по-долу.
Изтегли официалното приложение на Ollama за macOS или Windows. За Linux използвай инструкциите за инсталиране на Ollama. След инсталацията отвори приложението; на Linux изпълни ollama serve, ако Ollama още не приема заявки.
Актуалното приложение на Ollama поддържа и локална работа, и облачни функции. Избери таг на изтеглен локален модел: за локална инференция изобщо не е нужно да влизаш в профил.
За да следваш примерите, изтегли модела с точния таг qwen3.5:4b-q4_K_M. Файлът е 3,4 GB. Тагът има значение: общото означение „latest“ може неусетно да посочи много по-голям модел от тествания. Размерът на изтегления файл показва колко място заема на диска, не колко RAM ще му трябва при работа.
За първия разговор с модела ти трябват две команди:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Първата изтегля модела. Втората отваря интерактивен чат с него. Задай му кратка, реална задача вместо обикновен поздрав, например: „Превърни тези три бележки от срещата в списък със задачи. Не измисляй дати.“
Когато приключиш, въведи /bye, за да излезеш от чата.
Досега чатът в терминала изпращаше заявки към софтуера за инференция. Сега изпрати заявка направо към него, както би направило друго приложение.
На macOS или Linux:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Дай определение за локална инференция в едно изречение."}],"stream":false,"options":{"num_ctx":4096}}'
В PowerShell под Windows:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Дай определение за локална инференция в едно изречение."}],"stream":false,"options":{"num_ctx":4096}}'
В отговора потърси message.content. Задаването на stream като false заявява един завършен отговор, а не поток от части. С num_ctx: 4096 задаваш сравнително малък контекст спрямо много по-големия обявен максимум за модела.
Освен текста в message.content, Ollama връща и показатели, които си струва да погледнеш: load_duration, prompt_eval_count, prompt_eval_duration, eval_count и eval_duration.
Показателите разграничават две неща, които едно число за „токени в секунда“ смесва: времето за зареждане на модела в паметта и времето за генериране на отговора. Първата заявка след стартиране на Ollama обикновено отнема най-много време, защото моделът трябва да се зареди. При следващата това вече не е нужно.
Точните стойности зависят изцяло от твоята машина, затова тук не посочваме числа като типични. Сравни показателите при две заявки на един и същ лаптоп, вместо да се водиш по едно-единствено твърдение за скоростта.
За основните задачи са достатъчни три команди: две за проверка и една за изтриване на ненужен модел.
ollama ps показва кой модел е зареден в момента и дали използва CPU, GPU или и двете: в колоната за процесора ще видиш 100% GPU, 100% CPU или разпределение между тях.
ollama ls изброява всички модели, които си изтеглил.
ollama rm qwen3.5:4b-q4_K_M изтрива изтеглен модел, който вече не ти трябва.
По подразбиране Ollama освобождава модела от паметта след пет минути бездействие. Ако в ollama ps не се вижда зареден модел, изпрати нова заявка, преди да решиш, че има проблем.
Свържи второто приложение със същия лаптоп вместо с облачна услуга. Така лаптопът вече отговаря и на неговите заявки, не само на тези от вградения чат.
Повечето приложения с възможност за собствен адрес на API, съвместим с OpenAI, искат базов URL адрес, име на модел и API ключ. Въведи http://localhost:11434/v1/ за базов адрес и qwen3.5:4b-q4_K_M за име на модела.
Неяснотата идва от полето за API ключ: някои приложения не позволяват да го оставиш празно. Затова документацията на Ollama дава примерната стойност api_key='ollama' и пояснява, че локалният сървър изисква непразно поле, но не проверява стойността. Този низ не удостоверява нищо: той само попълва поле, не е парола.
Съвместимостта обхваща само част от възможностите на всеки API. Преди да разчиташ на дадена функция, като подаване на изображения или извикване на инструменти, провери дали работи в твоето приложение. Не приемай, че всичко ще работи по същия начин.
Дори сега на теория заявките могат незабелязано да минават през интернет. Ето как да изключиш тази възможност.
След като моделът се изтегли, изключи Wi-Fi на лаптопа или извади мрежовия кабел. После повтори същата заявка в чата или през API. Ако моделът отговори без никаква връзка с интернет, имаш доказателство, че работи локално.
Не е доказателство, ако получаваш отговор само с включен интернет, ако той идва от https://ollama.com вместо от localhost или ако си избрал облачен таг вместо изтеглен модел. Локалните заявки Ollama обработва на твоята машина, а отделните облачни модели работят на външен сървър.
Поверителността не идва от само себе си. Важно е да знаеш кое те защитава и кое не.
По подразбиране Ollama приема връзки само на 127.0.0.1:11434, тоест само от твоя лаптоп. Остави настройката така. Не задавай OLLAMA_HOST=0.0.0.0 и не пренасочвай порт 11434 за публичен достъп през интернет: стойността на примерния API ключ от предишния раздел не се проверява. Ако отвориш порта за публичен достъп, все едно оставяш вратата отключена.
Ако искаш, можеш да изключиш изцяло облачните функции на Ollama. Не е задължително: с таг на изтеглен локален модел вече работиш локално. Добави {"disable_ollama_cloud": true} във файла ~/.ollama/server.json или задай OLLAMA_NO_CLOUD=1. След това рестартирай Ollama, независимо кой от двата начина си избрал.
Достъпът от друга стая или друго устройство е отделна, по-сложна тема: изисква частна мрежа и прокси сървър с удостоверяване пред Ollama. Не го разглеждаме тук; директното отваряне на порта не е решение.
Ето най-честите спънки и откъде да започнеш.
Връзката е отказана. Провери дали приложението Ollama е стартирано или работи ollama serve, после опитай отново.
Първият отговор идва бавно, следващите са по-бързи. Това е време за зареждане на модела, а не показател за скоростта на генериране. Виж полетата в отговора, описани по-горе, за да различиш двете.
Всичко ти се струва много по-бавно от очакваното. Изпълни ollama ps: може да се окаже, че моделът работи само на CPU или използва и CPU, и GPU. Провери поддръжката на видеокартата и драйверите за твоята операционна система.
Недостиг на памет или сривове. Избери таг за по-малък модел, намали num_ctx и затвори други приложения, които използват много памет, преди да опиташ отново.
Дискът се запълва. Виж изтеглените модели с ollama ls, после изтрий ненужните с ollama rm.
Ако този начин на работа не ти подхожда, например искаш да разглеждаш моделите през графичен интерфейс или да управляваш по-прецизно CPU и GPU, разгледай LM Studio или llama.cpp. В такъв случай има смисъл да смениш софтуера за инференция, не да поддържаш две настройки паралелно.
Трябва ли ми интернет след настройката? Не. След като моделът се изтегли, и разговорът с него, и заявките към API на Ollama работят напълно офлайн.
Защитава ли примерният API ключ достъпа до сървъра ми? Не. Локалният сървър на Ollama приема всяка непразна стойност, без да я проверява. Ключът, който някои приложения изискват, не е мярка за сигурност.
Остава ли запитването ми на лаптопа? Да, ако си избрал таг на изтеглен локален модел. Ollama предлага и отделни облачни модели, които работят на външен сървър. Дали моделът работи локално, или в облака, зависи от избрания таг, не от скрита настройка по подразбиране.
Трябва ли ми отделна видеокарта? Не. Лаптоп без отделна видеокарта може да изпълнява малък модел само на CPU, обикновено по-бавно. ollama ps показва точно как се обработва конкретната заявка.
Какво да направя, ако искам по-голям или друг модел? Смени тага в същите команди ollama pull и ollama run, но първо провери RAM и VRAM. За подробностите виж колко RAM е нужна на лаптопа ти за локален AI.
Ще помни ли документите ми занапред? Не. Моделът за чат сам по себе си не запазва трайно съдържанието на папка. За да търсиш в собствените си файлове, ти трябва отделен индекс на документи. Това е незадължителна настройка, която не разглеждаме тук.
Избери една реална задача и я изпълни и с двата клиента: вградения чат и второто приложение, което току-що свърза. Например обобщи лична бележка, подреди набор от файлове в групи с етикети или поискай разбираемо обяснение на кратък откъс от код.
Каквото и да избереш, запиши точния таг на модела, версията на софтуера за инференция, настройката за контекста, URL адреса и самата задача. Така по-късно ще можеш да повториш резултата. Същото ще може да направи и друг човек.
Ако се окаже, че на лаптопа ти не му стигат RAM или VRAM, струва си да обмислиш преминаване към лаптоп с повече памет. В следващия материал от поредицата ще научиш как да съставиш малък набор от модели: един за чат, един за код и един за търсене.
Абонирайте се за нашия бюлетин за първи път и спестете 15 €!
Никога повече не пропускайте оферта.
Информация за използването на лични данни може да бъде намерена в нашата Политика за поверителност.
Потвърдете регистрацията
Почти готово: Изпратихме ви имейл за потвърждение