Nešiojamasis atsako į klausimą be interneto ryšio. Tuomet, nieko nekeisdami, tą patį klausimą jam užduodate iš kitos tame pačiame kompiuteryje veikiančios programos ir vėl gaunate atsakymą. Šis antras žingsnis paverčia jūsų nešiojamąjį nedideliu asmeniniu DI serveriu, į kurį gali kreiptis kitos programos ir skriptai.
Čia paleisime jau atsisiųstą modelį, o ne mokysime jį nuo nulio. Jei dar nepatikrinote, ar jūsų kompiuteryje tam pakanka RAM arba VRAM, pirmiausia pasidomėkite, kiek RAM reikia nešiojamajam kompiuteriui vietiniam DI. Jei jau žinote, kad kompiuterio pajėgumų pakanka, skaitykite toliau.
Vietinio DI sąranką galima suskirstyti į keturis sluoksnius. Kai žinote, už ką kiekvienas atsakingas, lengviau atlikti tolesnius veiksmus.
Modelio svoriai yra failas, kurį atsisiunčiate. Pavyzdžiui, kvantuota nedidelio modelio versija užima 3,4 GB disko vietos. Tai nepasako, kiek RAM reikės modeliui veikiant.
Modelio vykdymo variklis įkelia modelio svorius ir atsako į užklausas. Čia naudosime „Ollama“ ir jos vietinę HTTP API. Per ją jūsų nešiojamajame veikiančiu modeliu galės naudotis kitos programos.
Užklausų siuntėjas gali būti integruota „Ollama“ pokalbių sąsaja, trumpas skriptas ar kita programa. Nuo jo priklauso, ar užklausa liks nešiojamajame, ar bus siunčiama kitur.
Pasirenkamas dokumentų indeksas leidžia pokalbių modeliui ieškoti jūsų failuose. Jam reikia atskiro įterpinių modelio ir atskiros saugyklos. Automatiškai indeksas nesukuriamas; šiame gide jo neaptarsime.
Trumpai: programa arba skriptas siunčia užklausą „Ollama“ adresu 127.0.0.1:11434, o ši įkelia atsisiųstą modelį. Pašalinus modelį, užklausas siuntusioje programoje išsaugota pokalbių istorija nedingsta: šie duomenys laikomi atskirai.
Prieš ką nors diegdami skirkite dvi minutes ir užsirašykite savo nešiojamojo duomenis: RAM kiekį, operacinę sistemą, procesorių, ar jis turi atskiros vaizdo atminties (VRAM), ir kiek laisvos vietos liko SSD diske. Daugiau apie tai, kiek RAM reikia nešiojamajam kompiuteriui vietiniam DI, skaitykite atskirame straipsnyje.
Abu toliau pateikti nešiojamieji šiuo metu siūlomi refurbed. Abu atnaujinti: profesionaliai patikrinti, išvalyti ir sutvarkyti; kiekvienam suteikiama 12 mėnesių garantija. Vienas priklauso pradinei „Apple Silicon“ kompiuterių klasei, kitas yra „Windows“ nešiojamasis su atskira vaizdo atmintimi. Abiejų pakanka visiems toliau aprašytiems veiksmams atlikti.
Pradėkite nuo oficialios „Ollama“ programos, skirtos „macOS“ arba „Windows“, o „Linux“ sistemoje vadovaukitės jos diegimo instrukcijomis. Įdiegę paleiskite „Ollama“. Jei „Linux“ sistemoje ji dar nepriima užklausų, paleiskite ollama serve.
Dabartinėje „Ollama“ programoje siūlomi ir vietiniai modeliai, ir debesijos galimybės. Rinkitės atsisiųstą vietinį modelį: jam paleisti paskyros nereikia.
Kad galėtumėte sekti pavyzdžiu, atsisiųskite konkretų modelio variantą qwen3.5:4b-q4_K_M. Jo atsisiuntimo dydis yra 3,4 GB. Tikslus žymuo svarbus: bendrinė žyma „latest“ gali nepastebimai nurodyti gerokai didesnį modelį nei išbandytasis. Šie 3,4 GB rodo atsisiunčiamo failo dydį, o ne kiek RAM reikės modeliui atsakinėjant į užklausas.
Pirmajam pokalbiui su modeliu pakanka dviejų komandų:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Pirmąja komanda atsisiųsite modelį, antrąja pradėsite su juo pokalbį. Vietoj paprasto pasisveikinimo skirkite jam nedidelę, bet tikrą užduotį, pavyzdžiui: „Iš šių trijų susitikimo užrašų sudaryk darbų sąrašą. Neišgalvok datų.“
Baigę pokalbį išeikite iš jo įvedę /bye.
Terminale užklausą vykdymo varikliui siunčia pokalbių sąsaja. Dabar kreipkitės į tą patį variklį tiesiogiai, kaip tai darytų kita programa.
„macOS“ arba „Linux“ sistemoje:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Vienu sakiniu apibrėžk vietinę inferenciją."}],"stream":false,"options":{"num_ctx":4096}}'
„Windows“ sistemoje per „PowerShell“:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Vienu sakiniu apibrėžk vietinę inferenciją."}],"stream":false,"options":{"num_ctx":4096}}'
Atsakymą rasite lauke message.content. Nustačius stream reikšmę false, jis pateikiamas visas iš karto, o ne dalimis. Dėl nustatymo num_ctx: 4096 pirmasis bandymas naudoja palyginti nedidelį kontekstą, gerokai mažesnį už skelbiamą didžiausią modelio kontekstą.
Be atsakymo teksto, „Ollama“ kartu su message.content pateikia ir veikimo duomenis: load_duration, prompt_eval_count, prompt_eval_duration, eval_count ir eval_duration.
Jie padeda atskirti tai, ką vienas „tokenų per sekundę“ rodiklis suplaka į vieną: laiką modeliui įkelti į atmintį ir laiką atsakymui sugeneruoti. Pirmoji užklausa paleidus „Ollama“ paprastai trunka ilgiausiai, nes modelį dar reikia įkelti; kitai užklausai to nebereikia.
Konkretūs skaičiai priklauso tik nuo jūsų kompiuterio, todėl čia jų nepateikiame kaip tipiškų rezultatų. Vietoj vieno teiginio apie spartą palyginkite šiuos laukus po dviejų bandymų tame pačiame nešiojamajame.
Pagrindiniams veiksmams pakaks trijų komandų.
ollama ps parodo, kurie modeliai dabar įkelti ir kur jie veikia: procesoriaus stulpelyje matysite 100 % GPU, 100 % CPU arba darbą, paskirstytą tarp jų.
ollama ls pateikia visų atsisiųstų modelių sąrašą.
ollama rm qwen3.5:4b-q4_K_M pašalina nebereikalingą atsisiųstą modelį.
Pagal numatytuosius nustatymus „Ollama“ iškelia modelį po penkių neveikimo minučių. Jei ollama ps nerodo nė vieno įkelto modelio, dar kartą pateikite užklausą, o ne iškart ieškokite gedimo.
Dabar jūsų nešiojamajame veikiantis modelis gali atsakyti ir kitai programai. Nukreipkite ją į tą patį kompiuterį, o ne į debesijos paslaugą.
Dauguma programų, kuriose galima nurodyti su OpenAI suderinamos API adresą, prašo trijų dalykų: bazinio URL, modelio pavadinimo ir API rakto. Kaip bazinį URL nurodykite http://localhost:11434/v1/, o kaip modelio pavadinimą nurodykite qwen3.5:4b-q4_K_M.
API rakto laukelis gali suklaidinti. Kai kurios programos neleidžia jo palikti tuščio, todėl „Ollama“ dokumentacijoje pateikiamas pavyzdys api_key='ollama'. Joje aiškiai rašoma, kad vietiniam serveriui laukas turi būti netuščias, tačiau įrašytos reikšmės jis netikrina. Šia reikšme niekieno tapatybė netikrinama: tai tik įrašas privalomam laukui užpildyti, o ne slaptažodis.
API suderinamumas yra dalinis. Prieš pasikliaudami, pavyzdžiui, vaizdų įvestimi ar įrankių iškvietimu, išbandykite būtent tą funkciją savo programoje.
Teoriškai iki šiol užklausos galėjo nepastebimai keliauti internetu. Štai kaip įsitikinti, kad taip nėra.
Kai modelis bus visiškai atsisiųstas, išjunkite nešiojamojo „Wi-Fi“ ryšį arba atjunkite tinklo kabelį. Tada pakartokite tą pačią užklausą pokalbių lange arba per API. Jei atsakymą gausite be jokio interneto ryšio, tai bus aiškus įrodymas, kad modelis veikia jūsų kompiuteryje.
Vietinio veikimo neįrodo atsakymas, gaunamas tik esant interneto ryšiui, kreipimasis į https://ollama.com, o ne localhost, ar debesijos modelio žymuo vietoj atsisiųstojo. „Ollama“ vietinę užklausą apdoroja jūsų kompiuteryje, o atskiri debesijos modeliai veikia nuotoliniu būdu.
Vietinis DI savaime dar nereiškia privatumo. Verta žinoti, kurie nustatymai jus saugo, o kurie ne.
Pagal numatytuosius nustatymus „Ollama“ priima užklausas tik adresu 127.0.0.1:11434, vadinasi, tik iš jūsų nešiojamojo. Šio nustatymo nekeiskite. Nenustatykite OLLAMA_HOST=0.0.0.0 ir neatverkite 11434 prievado viešajam internetui. Ankstesniame skyriuje minėtas pavyzdinis API raktas tapatybės netikrina, todėl viešai atvėrę prievadą neapsaugotumėte prieigos.
Jei norite visiškai išjungti „Ollama“ debesijos funkcijas, galite tai padaryti. Vietiniam modeliui to nereikia: atsisiųsto vietinio modelio žymuo jau reiškia vietinį veikimą. Į failą ~/.ollama/server.json įrašykite {"disable_ollama_cloud": true} arba nustatykite OLLAMA_NO_CLOUD=1. Kad pasirinktas nustatymas įsigaliotų, iš naujo paleiskite „Ollama“.
Jei šią sąranką norėsite pasiekti iš kito kambario ar įrenginio, reikės privataus tinklo ir tarpinio serverio, kuris tikrina tapatybę. Tai atskira, sudėtingesnė tema, kurios čia neaptariame. Tiesiogiai atverti prievadą nėra tinkamas būdas.
Dažniausiai pasitaiko šios kliūtys. Štai ką patikrinti pirmiausia.
Ryšys atmestas. Patikrinkite, ar veikia „Ollama“ programa arba ollama serve, tada bandykite dar kartą.
Pirmasis atsakymas lėtas, o vėlesni greitesni. Taip yra dėl modelio įkėlimo laiko, o ne atsakymo generavimo spartos. Skirtumą matysite anksčiau aptartuose atsakymo laukuose.
Atrodo, kad viskas vyksta daug lėčiau, nei tikėjotės. Paleiskite ollama ps: gali paaiškėti, kad modelis veikia vien CPU arba darbas paskirstytas CPU ir GPU. Patikrinkite, ar jūsų GPU ir jo tvarkyklės palaikomi naudojamoje operacinėje sistemoje.
Trūksta atminties arba programa netikėtai užsidaro. Rinkitės mažesnį modelio variantą, sumažinkite num_ctx ir prieš bandydami dar kartą užverkite kitas daug atminties naudojančias programas.
Diske senka vieta. Komanda ollama ls parodys, ką atsisiuntėte. Nebenaudojamus modelius pašalinkite komanda ollama rm.
Jei toks būdas jums netinka, pavyzdžiui, norite grafinės modelių naršyklės arba tikslesnio CPU ir GPU darbo valdymo, verta pasidomėti „LM Studio“ ir „llama.cpp“. Tuomet prasminga svarstyti kitą vykdymo variklį, o ne vienu metu palaikyti dvi sąrankas.
Ar po sąrankos dar reikia interneto? Ne. Atsisiuntus modelį, tiek pokalbis su juo, tiek užklausos per API veikia visiškai be interneto.
Ar pavyzdinis API raktas apsaugo prieigą prie mano API? Ne. Vietinis „Ollama“ serveris priima bet kurią netuščią reikšmę, bet jos netikrina. Kai kurių programų prašomas raktas nėra apsaugos priemonė.
Ar mano užklausa lieka nešiojamajame? Taip, jei naudojate atsisiųsto vietinio modelio žymenį. „Ollama“ taip pat siūlo atskirus debesijos modelius, kurie veikia nuotoliniu būdu. Skirtumą lemia jūsų pasirinktas modelio žymuo, o ne koks nors paslėptas numatytasis nustatymas.
Ar būtina atskira vaizdo plokštė? Ne. Nešiojamasis gali paleisti nedidelį modelį naudodamas vien CPU, nors paprastai jis veiks lėčiau. ollama ps parodys, kaip buvo vykdoma konkreti užklausa.
Kaip paleisti didesnį ar kitą modelį? Pakeiskite modelio žymenį komandose ollama pull ir ollama run, bet pirmiau patikrinkite RAM ir VRAM. Išsamesnį paaiškinimą rasite straipsnyje apie tai, kiek RAM reikia nešiojamajam kompiuteriui vietiniam DI.
Ar nuo šiol modelis prisimins mano dokumentus? Ne. Pokalbių modelis savaime neišsaugo aplanko turinio visam laikui. Norint ieškoti savo failuose, reikia atskiro dokumentų indekso. Tai pasirenkama sąranka, kurios čia neaptariame.
Pasirinkite vieną tikrą užduotį ir atlikite ją abiem būdais: per integruotą pokalbių langą ir per ką tik prijungtą programą. Pavyzdžiui, galite paprašyti apibendrinti asmeninį užrašą, sugrupuoti failų rinkinį ir suteikti grupėms pavadinimus arba paprastai paaiškinti trumpą kodo ištrauką.
Kad ir kurią užduotį pasirinktumėte, užsirašykite tikslų modelio žymenį, vykdymo variklio versiją, konteksto nustatymą, URL adresą ir pačią užduotį. Taip vėliau rezultatą galėsite atkartoti ir jūs, ir kiti, atliekantys tą patį bandymą.
Jei paaiškėjo, kad jūsų nešiojamajame šiai užduočiai trūksta RAM ar VRAM, verta pagalvoti apie daugiau atminties turintį kompiuterį. Kitame šios serijos straipsnyje aptarsime, kaip susidaryti nedidelį modelių rinkinį: po vieną pokalbiams, kodui ir paieškai.
Pirmą kartą užsisakykite mūsų naujienlaiškį ir sutaupykite 15 €!
Nebepraleisk nė vieno pasiūlymo.
Informaciją apie asmens duomenų naudojimą rasi mūsų Privatumo politikoje.
Patvirtinti registraciją
Beveik baigta: jums išsiuntėme patvirtinimo laišką