Språkmodeller.no

Norske språkmodeller

Norge har et aktivt miljø for åpne språkmodeller — fra Nasjonalbibliotekets Borealis-serie (270M–27B) og Borealis 2 (26B MoE) til NorwAI fra NTNU, NORA.LLM-initiativet og nordisk talegjenkjenning med NB-Whisper og hviske. NbAiLab (Nasjonalbiblioteket AI Lab) leder utviklingen med over 248 modeller publisert på Hugging Face, inkludert tekstgenerering, talegjenkjenning, talesyntese, oversettelse og samisk språkteknologi. Sist oppdatert: 21. august 2026.

📢 Nytt august 2026

Nasjonalbiblioteket AI Lab (NbAiLab) — Norges sentrale aktør for norsk språkteknologi

NbAiLab (Nasjonalbiblioteket AI Lab) er Norges nasjonale forskningslaboratorium for språkteknologi og kunstig intelligens. Laben er en del av Nasjonalbiblioteket og har rundt 40 medarbeidere som arbeider med å utvikle åpne norske språkmodeller, talegjenkjenning, talesyntese, datasett og verktøy for norsk språk.

Siden oppstarten har NbAiLab publisert over 248 modeller og 40 datasett på Hugging Face, og driver 18 demoapplikasjoner. Laboratoriet er organisert under Nasjonalbibliotekets digitaliseringsavdeling og samarbeider tett med norske universiteter, NORA.LLM-nettverket, nordiske partnere og europeiske initiativ som EuroHPC og HPLT.

Misjon og mandat

NbAiLabs kjerneoppgave er å sikre at det finnes åpne, høykvalitets språkmodeller for norsk — bokmål, nynorsk og samiske språk. Laboratoriet arbeider ut fra prinsippet om at norsk språkteknologi er digital infrastruktur på linje med veier og jernbane, og at tilgang til egne språkmodeller er et spørsmål om digital suverenitet.

I praksis betyr dette at NbAiLab:

Kontakt: ailab@nb.no | GitHub: github.com/NbAiLab | Nettside: ai.nb.no

Borealis 2 — neste generasjon norsk språkmodell (august 2026)

Borealis 2 26B-A4B er den nyeste og mest avanserte norske språkmodellen fra NbAiLab, lansert 21. august 2026. Den representerer et generasjonsskifte fra Borealis 1-serien ved å bruke Mixture of Experts (MoE)-arkitektur fra Google Gemma 4.

Teknisk arkitektur

Totale parametere 26 milliarder (26B)
Aktive parametere 4 milliarder (4B) per forward pass
Arkitektur Mixture of Experts (MoE) basert på Gemma 4
Basemodell google/gemma-4-26B-A4B-it (instruksjonstrent)
Modalitet Multimodal — bilde + tekst (Image-Text-to-Text)
Tensortype BF16
Format Safetensors + GGUF-kvantiseringer tilgjengelig
Chat-mal Gemma 4 chat template (inkludert)
Lisens NB-lisens 1.0 (Apache 2.0 med bruksrestriksjoner)
Status Preview — tidlig evaluering

Hva betyr Mixture of Experts (MoE)?

I en tradisjonell «tett» modell brukes alle parametere for hvert eneste token. I en MoE-modell er parameterne fordelt på flere «eksperter», og en rutingsmekanisme velger hvilke eksperter som aktiveres for hvert token. For Borealis 2 betyr dette:

Dette gjør Borealis 2 til en praktisk modell for norske bedrifter og forskere som trenger høy kvalitet uten kostbar infrastruktur.

Treningsprosessen

Borealis 2 er trent i tre steg:

  1. Basemodell: Starter fra Google Gemma 4 26B-A4B-it (instruksjonstrent versjon)
  2. Videretrening (continued pre-training): Trent videre på Aurora 2604-datasettet med 47 milliarder ord
  3. Instruksjonstuning (SFT): To epoker på NbAiLab/aurora-sft-2606, der tap kun beregnes på assistentens svar (bruker- og system-tokens er maskert)

Bruksområder for Borealis 2

Kjøring og distribusjon

Borealis 2 kan kjøres med Transformers, vLLM, SGLang og Docker Model Runner. GGUF-kvantiseringer (5 varianter) gjør det mulig å bruke modellen i llama.cpp, LM Studio, Jan og Ollama for lokal kjøring.

Last ned Borealis 2 26B-A4B fra Hugging Face →

Aurora-datasettet — Norges største treningskorpus for språkmodeller

Aurora 2604 er det store treningsdatasettet som driver Borealis-modellene. Datasettet ble ferdigstilt i april 2026 og inneholder 47 milliarder ord (whitespace-separert) med en kunnskapsgrense satt til 1. januar 2025.

Språkfordeling i Aurora 2604

Språk Ord Andel
Norsk bokmål 24,3 mrd. 51 %
Norsk nynorsk 11,1 mrd. 23 %
Dansk 4,6 mrd. 10 %
Svensk 2,5 mrd. 5 %
Engelsk 2,4 mrd. 5 %
Færøysk 1,5 mrd. 3 %
Islandsk 618 mill. 1,3 %
Nordsamisk 137 mill. 0,3 %

Datasettet inkluderer også finsk, lulesamisk, sørsamisk og norrønt. Totalt før oppsampling var korpuset 35,9 milliarder ord — omtrent 11,7 milliarder ord ble lagt til gjennom oppsampling av underrepresenterte språk.

Datakilder

Kilde Ord
HPLT 3.0 (nettcrawl) 15,0 mrd.
FineWeb-2 (kuratert nett) 14,6 mrd.
NB-newspapers-MBL (norske aviser via Kopinor) 6,4 mrd.
FinePDFs (akademiske dokumenter) 5,9 mrd.
Maalfrid-crawl (offentlige nettsider) 995 mill.
Swallow Code v2 (kode) 848 mill.
NB-books-OCR (digitaliserte bøker) 817 mill.
MegaMath (matematikk) 795 mill.
FineWeb-2 HQ (høykvalitetsutvalg) 440 mill.
FineWiki (Wikipedia) 425 mill.

Aurora kombinerer altså offentlig tilgjengelige nettkilder, Nasjonalbibliotekets egne digitaliserte samlinger (bøker, aviser), akademisk materiale, kode og strukturerte kunnskapskilder — alt kuratert og kvalitetssikret for norsk språkmodelltrening.

Kopinor-avtalen — lovlig tilgang til norsk pressemateriale

Et unikt aspekt ved norske språkmodeller er Kopinor-avtalen. Den norske staten, gjennom Nasjonalbiblioteket, har inngått en avtale med Kopinor på vegne av Mediebedriftenes Landsforening (MBL) som gir lovlig tilgang til opphavsrettsbeskyttet pressemateriale for trening, utvikling, vedlikehold og offentlig utgivelse av norske språkmodeller.

Avtalen dekker publikasjoner opp til ett år før modellpublisering — for Borealis 2 betyr det materiale publisert før januar 2025. Dette er unikt i verdenssammenheng og gir norske modeller lovlig tilgang til høykvalitets norsk journalistikk som treningsdata.

Foreløpig er bare et begrenset utvalg brukt — primært for å lære modellen å generere avisoverskrifter og ingresser. NbAiLab planlegger å utvide bruken med full videretrening på avismateriale i fremtidige utgivelser.

Bruksrestriksjoner under NB-lisens 1.0

Borealis 1 — den komplette modellserien (Gemma 3)

Den første generasjonen Borealis er basert på Google Gemma 3-arkitekturen og utgjør en komplett serie fra svært små til fullskala modeller. Serien finnes i to varianter: full release (med Kopinor-data) og open (uten opphavsrettsbeskyttet materiale).

Alle størrelser i Borealis-familien

Modell Parametere Modalitet Bruksområde
Borealis-270M 270 mill. Tekst Edge-enheter, CPU, rask prototyping
Borealis-1B 1 mrd. Tekst Bærbare maskiner, enkle oppgaver
Borealis-4B 4 mrd. Multimodal Chatbot, bildeanalyse, klassifisering
Borealis-12B 12 mrd. Multimodal Balansert assistent, analyse, innholdsskriving
Borealis-27B 27 mrd. Multimodal Fullskala assistent, resonnering, skrivestilvurdering

Prompt baking — innovativ sikkerhetsmetode

Borealis 27B bruker en unik tilnærming til sikkerhetsjustering kalt prompt baking (via verktøyet bakery). Metoden fungerer slik:

  1. En LoRA-adapter trenes til å minimere KL-divergens mellom modellen med sikkerhetsprompt og modellen med LoRA men uten prompt
  2. Effekten av sikkerhetsprompten «bakes» inn i modellvektene
  3. Adapteren merges med en skaleringsfaktor på 0,25 — optimal balanse mellom sikkerhet og nytte

Resultatet er en modell som oppfører seg tryggere uten å trenge en eksplisitt system-prompt for sikkerhet — atferden er integrert i vektene.

Tilgjengelighet og formater

Last ned Borealis 27B fra Hugging Face →

Norsk talesyntese — VoxCPM2 fra NbAiLab

I tillegg til tekstmodeller og talegjenkjenning utvikler NbAiLab også norsk talesyntese (Text-to-Speech, TTS). Flaggskipmodellen er VoxCPM2 — en 2B-parameter TTS-modell med norske stemmer.

Norsk TTS er viktig for tilgjengelighet (universell utforming), lydbokproduksjon, kundeservice-automatisering og navigasjonssystemer som trenger naturlig norsk tale.

Samisk språkteknologi — NbAiLabs arbeid med urfolksspråk

NbAiLab har et dedikert prosjekt for samisk språkteknologi som dekker både talegjenkjenning (ASR) og talesyntese (TTS) for nordsamisk og lulesamisk. Med 137 millioner ord nordsamisk i Aurora-datasettet får også tekstmodellene en viss samisk kompetanse.

Samiske ASR-modeller (talegjenkjenning)

Samisk TTS (talesyntese)

Samisk språkteknologi er kritisk for bevaring og revitalisering av urfolksspråk i Norge. NbAiLabs arbeid gjør det mulig å bygge samiske digitale verktøy — fra diktering og underteksting til talebaserte grensesnitt og utdanningsressurser.

Komplett oversikt over NbAiLabs modeller og prosjekter

NbAiLab har publisert over 248 modeller. Her er de viktigste kategoriene:

Tekstgenerering (LLM)

  • Borealis 2 26B-A4B (Gemma 4, MoE)
  • Borealis-familien 270M–27B (Gemma 3)
  • nb-gpt-gemma4 26B (Gemma 4, tett)
  • NB-Llama-3.2 (1B og 3B)

Talegjenkjenning (ASR)

  • NB-Whisper (norsk, 39M–1.5B)
  • Samisk ASR (Parakeet, Nemotron)
  • Streaming ASR (sanntid)

Talesyntese (TTS)

  • VoxCPM2 (norsk, 2B)
  • salmon-f5-tts (nordsamisk)
  • NB-TTS-samlingen (20 varianter)

Oversettelse og NLU

  • TranslateGemma 4B (bokmål ↔ nynorsk)
  • NB-BERT (norsk tekstforståelse)
  • RoBERTa NCC (fill-mask)

Viktige datasett fra NbAiLab

Eksisterende norske modeller

Borealis 2 26B-A4B (NbAiLab)

Neste generasjon i Borealis-familien — en Mixture of Experts-modell med 26B totale parametere, men kun 4B aktive under inferens. Bygget på Gemma 4-arkitekturen med videretrening på Aurora 2604-datasettet (47 milliarder ord, kunnskapsgrense januar 2025) og SFT på aurora-sft-2606.

  • 26B total / 4B aktive parametere (MoE-arkitektur)
  • Multimodal: bilde + tekst (Image-Text-to-Text)
  • Norsk-sentrisk: bokmål, nynorsk, dansk, svensk, engelsk og samisk
  • Assistentoppgaver: skriving, oppsummering, Q&A, resonnering
  • Vurdering av norsk skrivestil og kvalitet
  • Preview-versjon — ikke fullstendig safety-alignet
  • NB-lisens 1.0 (basert på Apache 2.0 med bruksrestriksjoner)

Se Borealis 2 26B-A4B på Hugging Face →

nb-gpt-gemma4 (NbAiLab)

NbAiLabs nyeste modellserie bygget på Gemma 4-arkitekturen. Inkluderer 26B multimodal instruksjonsmodell med Aurora SFT-trening, samt mindre varianter (e4b, e2b) med hyppige oppdateringer gjennom 2026.

  • 26B multimodal (Image-Text-to-Text) som flaggskip
  • Basert på Google Gemma 4 med norsk fintilpasning
  • Instruksjonsvariant med Aurora SFT-trening
  • Flere størrelser for ulike bruksscenarier
  • Aktiv utvikling — nye versjoner regelmessig

Se nb-gpt-gemma4 26B på Hugging Face →

TranslateGemma 4B (NbAiLab)

Spesialisert oversettelsesmodell for bokmål ↔ nynorsk, bygget på Gemma-arkitekturen. Optimalisert for høykvalitets norsk oversettelse mellom målformene.

  • 4B-størrelse — kan kjøres på forbrukerhardware
  • Spesialtrent for norsk målformkonvertering
  • Nyttig for offentlig sektor, media og utdanning
  • Åpen modell fra NbAiLab

Se TranslateGemma 4B på Hugging Face →

Borealis-familien (NbAiLab)

Nasjonalbiblioteket (NbAiLab) har lansert Borealis som en komplett serie åpne språkmodeller bygget på Gemma 3-arkitekturen. Familien spenner fra 270M til 27B parametere, med multimodal støtte (bilde + tekst) fra 4B og opp.

  • 270M og 1B — tekstgenerering, kjører på CPU og edge-enheter
  • 4B og 12B — multimodal (Image-Text-to-Text), god balanse for norsk chatbot og analyse
  • 27B — fullskala norsk assistent med oppsummering, Q&A, resonnering og vurdering av norsk skrivestil
  • Instruksjons-varianter (instruct-preview) og åpne base-modeller (borealis-open)
  • Tilgjengelig i GGUF (llama.cpp/Ollama), MLX (Apple Silicon) og safetensors
  • Støtter bokmål, nynorsk og samiske språk
  • Trent med Aurora SFT-datasett fra Nasjonalbibliotekets samlinger
  • Gemma-lisens — egnet for forskning og mange produksjonsscenarier

Se Borealis 27B på Hugging Face →

NB-Llama-3.2 (NbAiLab)

Nye Llama 3.2-baserte modeller i 1B og 3B-størrelse, lansert april 2026. Optimalisert spesifikt for norsk tekst med bred nordisk språkdekning.

  • 1B-varianten kjører på CPU og enkle edge-enheter
  • 3B-varianten gir godt kompromiss for chatbot og klassifisering
  • Sterk flerspråklig støtte på nordiske språk
  • Bygget på Meta Llama 3.2-arkitekturen

Last ned fra NbAiLab på Hugging Face →

NorMistral (NORA.LLM)

NorMistral er en serie norsk-tilpassede modeller i NORA.LLM-initiativet. Finnes i 7B-warm, 11B og 11B-thinking-varianter. Nytt i 2026: NorMistral-11B-thinking med styrket resonnering og GGUF-distribusjon.

  • NorMistral-7B-warm: praktisk størrelse for produksjon og eksperimentering
  • NorMistral-11B-long: utvidet kontekst for lengre dokumenter
  • NorMistral-11B-thinking: reasoning-variant med GGUF for lokal kjøring
  • Kontinuerlig trent på store norske tekstkorpus
  • Åpne vekter via Hugging Face

NORA.LLM-modeller på Hugging Face →

NorwAI (NTNU)

NorwAI er et modellspor fra NTNU, tilgjengelig i Llama 2- og Mistral-arkitekturer. 7B og 45B-varianter er i produksjonsdrift for forskning og nordisk bedriftsbruk.

  • 7B: god balanse for egenhosting på standard server-GPU
  • 45B: høyere kapasitet for krevende norske oppgaver
  • Rettet mot akademia og nordiske industrimiljøer
  • Åpent tilgjengelig for forskning

NorwAI på Hugging Face →

Viking (AI Sweden / Nordisk samarbeid)

Viking er en flerspråklig nordisk modellserie utviklet av AI Sweden i samarbeid med nordiske partnere. Modellene har sterk norsk, svensk, dansk og finsk støtte med flere størrelser tilgjengelig.

  • Flerspråklig nordisk modell med sterk norskstøtte
  • Flere størrelser fra 7B til 33B
  • Åpent tilgjengelig for forskning og kommersielt bruk
  • Samarbeid mellom AI Sweden, WASP og nordiske aktører

AI Sweden-modeller på Hugging Face →

Nordisk samarbeid og ScandEval

Norsk KI-utvikling skjer ikke i isolasjon. Skandinaviske samarbeidsmodeller som ScandEval-benchmarks, GPT-SW3 (AI Sweden) og nordiske tekstkorpus styrker hele regionen.

  • ScandEval: delte evalueringsrammeverk for nordiske språk
  • GPT-SW3: skandinavisk modellserie fra AI Sweden
  • Felles datasett og korpus på tvers av landegrenser
  • Norsk deltagelse i europeiske KI-initiativ (HPLT, OPUS, EuroHPC)

Nordisk talegjenkjenning (ASR)

Nordiske små modeller for tale-til-tekst har utviklet seg raskt. NB-Whisper dekker norsk, mens hviske-serien fra syv.ai setter nye rekorder for dansk — begge med varianter små nok for edge og nettleser.

NB-Whisper (NbAiLab)

Norsk talegjenkjenning bygget på OpenAI Whisper-arkitekturen, trent på 20 000 timer norsk tale fra NRK, Stortinget, lydbøker og Nasjonalbibliotekets samlinger.

  • Tiny (39M) — kjører på CPU, egnet for edge og rask prototyping
  • Base (73M) og Small (244M) — god balanse
  • Medium (769M) — sterkere nøyaktighet
  • Large (1.5B) — beste kvalitet for norsk transkribering
  • Støtter bokmål, nynorsk og delvis engelsk
  • Semantiske varianter med bedre tegnsetting og grammatikk
  • CC BY 4.0-lisens — fri bruk også kommersielt

Se NB-Whisper Large på Hugging Face →

hviske-v5-tiny (syv.ai)

Dansk ASR-modell med bare 263M parametere, distillert fra et 2.1B-ensemble. 8× mindre enn læreren, men slår den på FTSpeech-benchmarket (7.15 WER). Ikke basert på Whisper — bruker egen cohere_asr-arkitektur.

  • 320× sanntid på RTX 3090, 87× på Apple M4 (MLX int4)
  • Kjører i nettleser via WebGPU — ingen data sendes til server
  • 13.84 WER gjennomsnitt på fem danske datasett
  • Tilgjengelig i GGUF (160 MB q4_k), MLX og ONNX
  • Svært relevant for norsk pga. språklikhet dansk–norsk
  • CC BY-NC 4.0 (kommersiell bruk krever separat lisens)

Se hviske-v5-tiny på Hugging Face →

hviske-v5.3 (syv.ai)

Flaggskipmodellen i hviske-serien — 2B parametere med Conformer encoder-decoder. Trent på CoRal v3-datasettet for dansk opplesning og samtale. Laveste CER på begge kategorier, slår Whisper large-v3 og kommersielle løsninger.

  • 425× sanntid — 60 minutter tale på 8.5 sekunder (RTX 3090)
  • 9.01% WER opplesning, 19.21% WER samtale (beam search)
  • Slår OpenAI gpt-4o-transcribe og ElevenLabs på dansk
  • vLLM-støtte med OpenAI-kompatibelt API-endepunkt
  • CC BY-NC 4.0-lisens

Se hviske-v5.3 på Hugging Face →

Samisk ASR (NbAiLab)

NbAiLab utvikler også talegjenkjenning for nordsamisk og lulesamisk, basert på NVIDIA NeMo Parakeet og Nemotron-arkitekturer. Under aktiv utvikling 2026.

  • nb-sami-asr-north-parakeet — nordsamisk modell
  • nb-sami-asr-north-nemotron — streaming-variant
  • salmon-whisper — Whisper fintrent for lulesamisk
  • Viktig for bevaring av samisk språk og kultur

Se samisk ASR på NbAiLab →

Hva er på vei

Borealis neste generasjon

Med Borealis-familien allerede lansert i 270M–27B størrelser, arbeider NbAiLab videre med forbedret instruksjonstuning, bedre multimodal støtte og bredere dekningsgrad av norsk dialekt og samisk.

  • Fra preview til fullversjon med safety-alignment
  • Forbedret multimodal (bilde + tekst) for alle størrelser
  • Utvidet samisk språkdekning og dialektstøtte
  • Potensielt Gemma 4-baserte Borealis-varianter

Fintrening og domenespesialisering

Det norske fagmiljøet jobber med fintrente varianter for helse, jus og offentlig forvaltning — der fagspråk og nøyaktighet er kritisk.

  • Norsk medisinsk NLP (Helse Sør-Øst og NTNU)
  • Juridisk norsk fra lovdata og domstolssystemet
  • Offentlig forvaltningsspråk (NAV, Skatteetaten)

Infrastruktur og compute

Tilgang på norsk og nordisk beregningsinfrastruktur er en forutsetning for å trene og drifte konkurransedyktige modeller i Europa.

  • LUMI-supercomputeren (Finland) brukes av norske forskningsmiljøer
  • Sigma2/NRIS gir norske akademikere tilgang til GPU-ressurser
  • Europeisk EuroHPC-initiativ styrker nordisk kapasitet

Digital suverenitet som drivkraft

Offentlig sektor og regulerte bransjer etterspør modeller som kan driftes innenfor norsk/europeisk jurisdiksjon. Dette driver investeringer i norske og nordiske modellspor fremover.

  • GDPR og personvernkrav favoriserer lokal drift
  • Offentlige anskaffelsesregler presser mot åpne modeller
  • Helsesektoren trenger suverene løsninger for pasientdata

Hvorfor små modeller er viktige

Strukturerte språkoppgaver

Små modeller er godt egnet for klassifisering, NER for norske navn, sentimentanalyse, oppsummering og uttrekk av nøkkelinformasjon.

De er også nyttige for oversettelse mellom bokmål og nynorsk, og på sikt mellom norske og samiske språkressurser.

Domenespesifikke fagsystemer

Fintrente modeller kan bli svært presise innen jus, helse, offentlig forvaltning, finans og teknisk dokumentasjon.

Når språkmodellen trenes på relevant fagspråk, øker treffsikkerhet og nytte i daglige arbeidsprosesser.

Digital suverenitet og personvern

Lokal drift gjør det mulig å behandle sensitive data uten å sende informasjon til utenlandske skytjenester.

Dette er særlig relevant for helsesektor, rettsvesen, forsvar, offentlig sektor og kritisk infrastruktur.

Kostnad og volum

Små modeller har lavere driftskostnad og responstid, noe som gjør dem egnet for høyvolumoppgaver som tagging, metadata-generering og batch-prosessering av store tekstsamlinger.

De passer også godt i chatboter, kundeservice og produkter der eksterne API-kall blir for dyrt eller for tregt.

Rolle i større KI-arkitektur

RAG-pipelines

Spørsmålsomskriving, reranking og svarvalidering på norsk før endelig respons sendes til brukeren.

Tale-til-tekst

NB-Whisper og hviske gir lokal transkribering av norsk/dansk tale som input til videre prosessering i KI-systemer.

Agentflyt

Ruting av forespørsler, verktøyvalg og enkel resonnering i flertrinns systemer med krav om rask respons.

Kvalitet på norsk

Kontroll av språkføring, klart språk og målform for bokmål og nynorsk i generert tekst.

Kulturarv, forskning og utdanning

Edge-distribusjon og bærekraft

De minste modellvariantene kan kjøres lokalt på bærbare maskiner, arbeidsstasjoner og enkelte mobile enheter. Dette gjør løsningene mer robuste i felt, ved ustabil nettilgang eller i isolerte miljøer.

Samtidig gir små modeller betydelig lavere energiforbruk per forespørsel enn svært store modeller, og kan derfor være et mer bærekraftig valg når oppgaven ikke krever en generell frontier-modell.

Oppsummering

Borealis og andre små, spesialiserte norske språkmodeller er ikke en erstatning for alle store modeller. De fyller en komplementær rolle: skreddersydd språkstøtte, lokal kontroll, lavere kostnad og raskere drift i mange praktiske anvendelser.

Kilder