Skip to content

// on_prem · egen_server

Kör språkmodellen på din egen server

En språkmodell behöver inte köras i någon annans moln. Modeller med öppna vikter går att ladda ner och köra på en server som du själv har kontroll över: i ditt serverrum, i din fabrik, eller på en EU-box som vi driver åt dig. Datan lämnar aldrig huset.

Det här är rätt val för en del företag och fel för andra. Vi säger vilket redan på första samtalet. För många räcker ett EU-hostat API med bra avtal, och då ska du inte köpa GPU:er. För andra, med ritningar, patientdata eller källkod som inte får lämna byggnaden, är egen server det enda som klarar granskningen.

Vi bygger båda varianterna. Den här sidan handlar om den lokala: vilka modeller som funkar på svenska, vad för hårdvara som krävs, vad det kostar i grova drag, och vad du får av oss.

Vad krävs för hårdvara?
01

När on-prem är rätt val, och när det inte är det

Rätt val när datan inte får lämna byggnaden. Konstruktionsritningar, källkod, patientjournaler, försvarsrelaterat material, kunddata under strikta avtal. Kräver ditt dataskyddsombud, din säkerhetschef eller din största kund att inget skickas till en extern server är egen server svaret. Också rätt val när volymen är hög och jämn: körs modellen dygnet runt kan egen hårdvara bli billigare än att betala per anrop.

Fel val när du bara vill prova. En pilot på tre månader ska inte börja med att köpa en GPU-server. Fel val också när uppgiften kräver den starkaste modellen som finns. De bästa öppna modellerna är bra, men de största slutna modellerna som Claude är fortfarande starkare på svåra resonemang. Är det den nivån du behöver, och datan tillåter det, kör vi Claude via ett EU-hostat upplägg i stället.

Många hamnar i mitten. Då bygger vi ett upplägg där känsliga dokument stannar på en lokal modell och resten går till en större modell inom EU. Det är inte antingen eller.

02

Öppna modeller som klarar svenska

Svenska var länge ett problem för öppna modeller. Det är det inte längre. De här familjerna använder vi i dag, och vi testar dem mot dina riktiga dokument innan vi väljer:

Mistral. Europeisk, snabb, bra på nordiska språk i de större varianterna. Ofta vårt förstahandsval för svensk text på egen hårdvara.

Llama från Meta. Bred familj i många storlekar, stort ekosystem av verktyg. Klarar svenska bra i de större modellerna.

Qwen. Starka modeller i alla storlekar, särskilt bra på kod och strukturerade uppgifter. Svenska är okej och blir bättre för varje version.

Gemma från Google. Små och effektiva modeller som passar när hårdvaran är begränsad.

GPT-SW3 från AI Sweden. Tränad specifikt på svenska och de nordiska språken. Äldre än de andra, men värd att känna till för rent svenska uppgifter.

Vi viftar inte med benchmark-siffror. De säger inte hur modellen hanterar just dina offerter eller manualer. Vi kör ett urval av dina dokument genom två eller tre kandidater, visar dig resultatet, och väljer tillsammans med dig.

03

Hårdvara i klartext

Modellstorlek räknas i miljarder parametrar, och det avgör vad du behöver för hårdvara.

En modell på 7-8 miljarder parametrar körs på ett enda bra grafikkort i en vanlig arbetsstation. Det räcker för intern sökning, sammanfattning, klassificering av mejl och enklare agenter. För många mindre företag är det här hela lösningen: en maskin i serverrummet.

Modeller i 30-miljardersklassen behöver ett kraftigare kort eller två, och passar när svaren ska vara märkbart bättre på svenska och på längre dokument.

Modeller i 70-miljardersklassen och uppåt kräver flera datacenter-GPU:er som jobbar tillsammans. Det är en riktig server med kylning och ström att räkna med, inte en burk under skrivbordet. Det här är nivån för hög volym eller riktigt svåra uppgifter.

Vi specar maskinen efter ditt behov, inte efter vad som ser imponerande ut. Vill du inte äga hårdvaran hyr vi en dedikerad GPU-server i EU åt dig, som vi driver och som bara din modell körs på.

04

Så fungerar kostnaden

Vi ger inga priser här, för de beror helt på din volym och din modell. Men så här hänger kostnaden ihop, så att du kan räkna själv.

Egen server kostar hårdvara en gång, sedan el och plats varje månad, plus vår tid för att sätta upp och underhålla. Kostnaden är i stort sett densamma oavsett om du kör tusen frågor om dagen eller hundra tusen. Det är poängen: hög och jämn volym gör egen server billig per fråga.

API kostar per token, alltså per mängd text in och ut. Ingen hårdvara, ingen el, ingen uppstart. Kostnaden växer linjärt med användningen. Låg eller ojämn volym gör API billigt totalt.

Brytpunkten ligger olika för olika företag. Vi räknar på den med dig. Ofta blir svaret en blandning: lokal modell för det känsliga och det som körs ofta, API för det tunga och sällsynta.

05

Vad vi levererar

En modell som står och snurrar på en server är inte en lösning. Det här är vad ett färdigt upplägg från oss innehåller:

Drift av modellen

Modellen körs som en tjänst med ett API som dina system kan prata med. Vi hanterar laddning, minne, parallella anrop och uppdatering till nya versioner.

Sökning i dina dokument

Manualer, avtal, ritningar, mejl och ärenden indexeras lokalt så att modellen svarar utifrån ditt innehåll och visar källan. Indexet ligger på samma server som modellen.

Agenter ovanpå

Supportagent, offertassistent eller intern hjälpreda som använder den lokala modellen och dina verktyg. Allt körs innanför din brandvägg.

Övervakning och drift

Vi ser när modellen svarar långsamt, när disken blir full och när det är dags att byta version. Du får larm, loggar och en tydlig bild av vad som används.

06

Datan lämnar aldrig huset

Med en lokal modell ser ingen extern part dina prompts, dokument eller svar. Ingen leverantör, ingen molnoperatör, ingen underleverantör. Det är inte ett löfte i ett avtal utan en fysisk gräns: kabeln går inte ut.

Väljer du en EU-box som vi driver i stället för egen hårdvara är gränsen vår server i Tyskland eller Finland. Bara din modell körs på den, vi tränar aldrig på din data, och vi skriver biträdesavtal som gör det tydligt. Det är det näst bästa efter egen server och gott nog för de flesta.

Oavsett upplägg loggar vi varje anrop lokalt så att du kan visa i efterhand vad systemet gjorde. Det är det som ditt dataskyddsombud kommer att fråga efter.

// vanliga_frågor

Vanliga frågor

Klarar en lokal modell verkligen svenska?

Ja, de större öppna modellerna gör det i dag. Mistral och Llama i sina större varianter skriver och förstår svenska bra nog för support, sammanfattning och sökning. Riktigt små modeller är svagare på svenska, så där testar vi noga innan vi lovar något. Vi kör alltid ett urval av dina egna dokument innan vi väljer modell.

Behöver vi köpa en GPU-server?

Inte nödvändigtvis. En mindre modell körs på en arbetsstation med ett bra grafikkort som du kanske redan har. Vill du inte köpa något alls hyr vi en dedikerad GPU-server i EU åt dig som vi driver. Egen hårdvara i huset är bara nödvändig när datan absolut inte får lämna byggnaden.

Hur uppdaterar vi modellen när det kommer nya versioner?

Vi bygger så att modellen är utbytbar. Kommer en bättre öppen modell testar vi den mot samma dokument som förra gången, och är resultatet bättre byter vi. Dina indexerade dokument, dina agenter och dina integrationer påverkas inte. Det ingår i driften om du har det avtalet med oss.

Är en lokal modell lika bra som Claude?

Nej, inte på de svåraste uppgifterna. De största slutna modellerna ligger fortfarande före på långa resonemang och komplicerade instruktioner. Men för sökning, sammanfattning, klassificering och de flesta supportfrågor är skillnaden liten eller ingen. Vi säger ärligt när din uppgift kräver den större modellen.

Kan vi börja i molnet och flytta hem senare?

Ja, och det är ofta det klokaste. Börja på en EU-server som vi driver, se vad som används och hur mycket, och flytta modellen till egen hårdvara när volymen eller kraven motiverar det. Vi bygger från början så att flytten är en driftsfråga, inte ett nytt projekt.

// läs_vidare

Har du data som inte får lämna huset?

Berätta vad det är och hur mycket du kör. Vi säger om egen server är rätt, vilken modell som passar, och vad för maskin som krävs. Ärligt, även om svaret är att ett EU-API räcker.