Norske språkmodeller
Norge har et aktivt miljø for åpne språkmodeller — fra
Nasjonalbibliotekets Borealis-serie (270M–27B) og Borealis 2 (26B MoE)
til NorwAI fra NTNU, NORA.LLM-initiativet og nordisk talegjenkjenning
med NB-Whisper og hviske. NbAiLab (Nasjonalbiblioteket AI Lab) leder
utviklingen med over 248 modeller publisert på Hugging Face, inkludert
tekstgenerering, talegjenkjenning, talesyntese, oversettelse og samisk
språkteknologi. Sist oppdatert: 21. august 2026.
📢 Nytt august 2026
-
Borealis 2 26B-A4B (NbAiLab) — ny Mixture of
Experts-modell med 26B totale parametere og kun 4B aktive under
inferens. Basert på Gemma 4, trent videre på Aurora 2604-datasettet
(47 mrd. ord). Multimodal (bilde + tekst), norsk-sentrisk assistent
for skriving, oppsummering, Q&A og resonnering. Preview-versjon.
-
Borealis-familien (NbAiLab) — komplett modellserie
fra 270M til 27B basert på Gemma 3. Multimodal (bilde + tekst) fra
4B og opp. Tilgjengelig i GGUF, MLX og safetensors.
Instruksjons-varianter og åpne base-modeller.
-
nb-gpt-gemma4-26B (NbAiLab) — ny 26B multimodal
modell basert på Gemma 4 med Aurora SFT-trening. Aktiv utvikling med
hyppige oppdateringer.
-
hviske-v5-tiny (syv.ai) — 263M dansk ASR-modell
distillert fra 2.1B ensemble. 320× sanntid på GPU, slår større
modeller på FTSpeech. Kjører i nettleser via WebGPU.
-
hviske-v5.3 (syv.ai) — 2B dansk talegjenkjenning
med 425× sanntid. Laveste CER på dansk, slår Whisper large-v3 og
kommersielle løsninger.
-
NB-Whisper (NbAiLab) — norsk talegjenkjenning i fem
størrelser (39M–2B), trent på 20 000 timer norsk tale fra NRK,
Stortinget og Nasjonalbiblioteket.
-
NorMistral-11B-thinking (NORA.LLM) — ny
reasoning-variant med GGUF-distribusjon for lokal kjøring med
styrket resonnering.
-
TranslateGemma 4B (NbAiLab) — spesialisert
oversettelsesmodell for bokmål ↔ nynorsk.
-
NB-Llama-3.2 (1B og 3B) fra NbAiLab — optimalisert
for bokmål, nynorsk og nordiske språk.
-
Viking (AI Sweden + nordisk samarbeid) —
flerspråklig nordisk modellserie med sterk norsk støtte, flere
størrelser tilgjengelig.
Nasjonalbiblioteket AI Lab (NbAiLab) — Norges sentrale aktør for norsk
språkteknologi
NbAiLab (Nasjonalbiblioteket AI Lab) er Norges
nasjonale forskningslaboratorium for språkteknologi og kunstig
intelligens. Laben er en del av Nasjonalbiblioteket
og har rundt 40 medarbeidere som arbeider med å utvikle åpne norske
språkmodeller, talegjenkjenning, talesyntese, datasett og verktøy for
norsk språk.
Siden oppstarten har NbAiLab publisert over
248 modeller og 40 datasett på
Hugging Face, og driver 18 demoapplikasjoner. Laboratoriet er
organisert under Nasjonalbibliotekets digitaliseringsavdeling og
samarbeider tett med norske universiteter, NORA.LLM-nettverket,
nordiske partnere og europeiske initiativ som EuroHPC og HPLT.
Misjon og mandat
NbAiLabs kjerneoppgave er å sikre at det finnes
åpne, høykvalitets språkmodeller for norsk — bokmål,
nynorsk og samiske språk. Laboratoriet arbeider ut fra prinsippet om
at norsk språkteknologi er digital infrastruktur på linje med veier og
jernbane, og at tilgang til egne språkmodeller er et spørsmål om
digital suverenitet.
I praksis betyr dette at NbAiLab:
-
Utvikler og publiserer åpne språkmodeller i alle størrelser — fra
270M til 27B parametere
-
Bygger og vedlikeholder store norske treningsdatasett
(Aurora-korpuset)
-
Tilbyr talegjenkjenning (NB-Whisper) og talesyntese (VoxCPM2) for
norsk
- Driver forskning på samisk språkteknologi med ASR og TTS
-
Samarbeider med presseorganisasjoner gjennom Kopinor-avtalen for
lovlig tilgang til treningsdata
-
Publiserer alt åpent på Hugging Face under permissive lisenser
- Signerer modellutgivelser kryptografisk for autentisering
Kontakt: ailab@nb.no | GitHub:
github.com/NbAiLab
| Nettside:
ai.nb.no
Borealis 2 — neste generasjon norsk språkmodell (august 2026)
Borealis 2 26B-A4B er den nyeste og mest avanserte
norske språkmodellen fra NbAiLab, lansert 21. august 2026. Den
representerer et generasjonsskifte fra Borealis 1-serien ved å bruke
Mixture of Experts (MoE)-arkitektur fra Google Gemma
4.
Teknisk arkitektur
|
Totale parametere
|
26 milliarder (26B) |
|
Aktive parametere
|
4 milliarder (4B) per forward pass
|
|
Arkitektur
|
Mixture of Experts (MoE) basert på Gemma 4
|
|
Basemodell
|
google/gemma-4-26B-A4B-it (instruksjonstrent)
|
| Modalitet |
Multimodal — bilde + tekst (Image-Text-to-Text)
|
|
Tensortype
|
BF16 |
| Format |
Safetensors + GGUF-kvantiseringer tilgjengelig
|
| Chat-mal |
Gemma 4 chat template (inkludert)
|
| Lisens |
NB-lisens 1.0 (Apache 2.0 med bruksrestriksjoner)
|
| Status |
Preview — tidlig evaluering |
Hva betyr Mixture of Experts (MoE)?
I en tradisjonell «tett» modell brukes alle parametere for hvert
eneste token. I en MoE-modell er parameterne fordelt på flere
«eksperter», og en rutingsmekanisme velger hvilke eksperter som
aktiveres for hvert token. For Borealis 2 betyr dette:
-
26B totalt — modellen har kapasiteten til en
26B-modell i form av lagret kunnskap
-
4B aktive — kun 4 milliarder parametere brukes per
inferens-steg
-
Raskere inferens — sammenlignbar hastighet med en
4B-modell, men med kvaliteten til en langt større
-
Lavere GPU-krav — kan kjøres på maskinvare som
normalt ville vært for svak for en full 26B-modell
Dette gjør Borealis 2 til en praktisk modell for norske bedrifter og
forskere som trenger høy kvalitet uten kostbar infrastruktur.
Treningsprosessen
Borealis 2 er trent i tre steg:
-
Basemodell: Starter fra Google Gemma 4 26B-A4B-it
(instruksjonstrent versjon)
-
Videretrening (continued pre-training): Trent
videre på Aurora 2604-datasettet med 47 milliarder ord
-
Instruksjonstuning (SFT): To epoker på
NbAiLab/aurora-sft-2606, der tap kun beregnes på assistentens svar
(bruker- og system-tokens er maskert)
Bruksområder for Borealis 2
-
Norsk-sentriske assistentoppgaver: utkast, redigering, forbedring av
tekst
- Oppsummering av norske dokumenter
- Spørsmål og svar (Q&A) på norsk
- Lett resonnering og analyse
- Vurdering av norsk skrivestil og språkkvalitet
- Multimodal: bildeanalyse kombinert med norsk tekst
- Forskning på norsk språkteknologi
Kjøring og distribusjon
Borealis 2 kan kjøres med Transformers, vLLM, SGLang og Docker Model
Runner. GGUF-kvantiseringer (5 varianter) gjør det mulig å bruke
modellen i llama.cpp, LM Studio, Jan og Ollama for lokal kjøring.
Last ned Borealis 2 26B-A4B fra Hugging Face →
Aurora-datasettet — Norges største treningskorpus for språkmodeller
Aurora 2604 er det store treningsdatasettet som
driver Borealis-modellene. Datasettet ble ferdigstilt i april 2026 og
inneholder 47 milliarder ord (whitespace-separert)
med en kunnskapsgrense satt til 1. januar 2025.
Språkfordeling i Aurora 2604
| Språk |
Ord |
Andel |
| Norsk bokmål |
24,3 mrd. |
51 % |
| Norsk nynorsk |
11,1 mrd. |
23 % |
| Dansk |
4,6 mrd. |
10 % |
| Svensk |
2,5 mrd. |
5 % |
| Engelsk |
2,4 mrd. |
5 % |
| Færøysk |
1,5 mrd. |
3 % |
| Islandsk |
618 mill. |
1,3 % |
| Nordsamisk |
137 mill. |
0,3 % |
Datasettet inkluderer også finsk, lulesamisk, sørsamisk og norrønt.
Totalt før oppsampling var korpuset 35,9 milliarder ord — omtrent 11,7
milliarder ord ble lagt til gjennom oppsampling av underrepresenterte
språk.
Datakilder
| Kilde |
Ord |
| HPLT 3.0 (nettcrawl) |
15,0 mrd. |
| FineWeb-2 (kuratert nett) |
14,6 mrd. |
|
NB-newspapers-MBL (norske aviser via Kopinor)
|
6,4 mrd. |
|
FinePDFs (akademiske dokumenter)
|
5,9 mrd. |
|
Maalfrid-crawl (offentlige nettsider)
|
995 mill. |
| Swallow Code v2 (kode) |
848 mill. |
|
NB-books-OCR (digitaliserte bøker)
|
817 mill. |
| MegaMath (matematikk) |
795 mill. |
|
FineWeb-2 HQ (høykvalitetsutvalg)
|
440 mill. |
| FineWiki (Wikipedia) |
425 mill. |
Aurora kombinerer altså offentlig tilgjengelige nettkilder,
Nasjonalbibliotekets egne digitaliserte samlinger (bøker, aviser),
akademisk materiale, kode og strukturerte kunnskapskilder — alt
kuratert og kvalitetssikret for norsk språkmodelltrening.
Kopinor-avtalen — lovlig tilgang til norsk pressemateriale
Et unikt aspekt ved norske språkmodeller er
Kopinor-avtalen. Den norske staten, gjennom
Nasjonalbiblioteket, har inngått en avtale med
Kopinor på vegne av
Mediebedriftenes Landsforening (MBL) som gir lovlig
tilgang til opphavsrettsbeskyttet pressemateriale for trening,
utvikling, vedlikehold og offentlig utgivelse av norske språkmodeller.
Avtalen dekker publikasjoner opp til ett år før modellpublisering —
for Borealis 2 betyr det materiale publisert før januar 2025. Dette er
unikt i verdenssammenheng og gir norske modeller
lovlig tilgang til høykvalitets norsk journalistikk som treningsdata.
Foreløpig er bare et begrenset utvalg brukt — primært for å lære
modellen å generere avisoverskrifter og ingresser. NbAiLab planlegger
å utvide bruken med full videretrening på avismateriale i fremtidige
utgivelser.
Bruksrestriksjoner under NB-lisens 1.0
-
Du kan ikke bruke modellen til å gjenskape
treningsdataene
-
Du kan ikke bruke outputs til tjenester der
hovedformålet er å gi tilgang til lisensierte pressepublikasjoner
-
All annen bruk — forskning, produktutvikling, kommersielle tjenester
— er tillatt
Borealis 1 — den komplette modellserien (Gemma 3)
Den første generasjonen Borealis er basert på
Google Gemma 3-arkitekturen og utgjør en komplett
serie fra svært små til fullskala modeller. Serien finnes i to
varianter: full release (med Kopinor-data) og
open
(uten opphavsrettsbeskyttet materiale).
Alle størrelser i Borealis-familien
| Modell |
Parametere |
Modalitet |
Bruksområde
|
| Borealis-270M |
270 mill. |
Tekst |
Edge-enheter, CPU, rask prototyping
|
| Borealis-1B |
1 mrd. |
Tekst |
Bærbare maskiner, enkle oppgaver
|
| Borealis-4B |
4 mrd. |
Multimodal |
Chatbot, bildeanalyse, klassifisering
|
| Borealis-12B |
12 mrd. |
Multimodal |
Balansert assistent, analyse, innholdsskriving
|
| Borealis-27B |
27 mrd. |
Multimodal |
Fullskala assistent, resonnering, skrivestilvurdering
|
Prompt baking — innovativ sikkerhetsmetode
Borealis 27B bruker en unik tilnærming til sikkerhetsjustering kalt
prompt baking (via verktøyet bakery).
Metoden fungerer slik:
-
En LoRA-adapter trenes til å minimere KL-divergens mellom modellen
med sikkerhetsprompt og modellen med LoRA men uten prompt
- Effekten av sikkerhetsprompten «bakes» inn i modellvektene
-
Adapteren merges med en skaleringsfaktor på 0,25 — optimal balanse
mellom sikkerhet og nytte
Resultatet er en modell som oppfører seg tryggere uten å trenge en
eksplisitt system-prompt for sikkerhet — atferden er integrert i
vektene.
Tilgjengelighet og formater
-
GGUF — for llama.cpp, Ollama, LM Studio, Jan (lokal
kjøring)
-
MLX — optimalisert for Apple Silicon (M1/M2/M3/M4)
-
MLX 8-bit — kvantisert for enda lavere minnebruk på
Mac
-
Safetensors — standard Hugging Face-format for
Transformers
-
vLLM og SGLang — for produksjonsservering med høy
gjennomstrømning
Last ned Borealis 27B fra Hugging Face →
Norsk talesyntese — VoxCPM2 fra NbAiLab
I tillegg til tekstmodeller og talegjenkjenning utvikler NbAiLab også
norsk talesyntese (Text-to-Speech, TTS).
Flaggskipmodellen er VoxCPM2 — en 2B-parameter
TTS-modell med norske stemmer.
- 2 milliarder parametere (fullstendig fintrent checkpoint)
- Norske mannlige og kvinnelige stemmer
- Trent på lydklipp mellom 3 og 30 sekunder
- Del av NB-TTS-samlingen med 20 modeller og varianter
-
Live demo tilgjengelig: «Norske stemmer · VoxCPM2» på Hugging Face
Spaces
Norsk TTS er viktig for tilgjengelighet (universell utforming),
lydbokproduksjon, kundeservice-automatisering og navigasjonssystemer
som trenger naturlig norsk tale.
Samisk språkteknologi — NbAiLabs arbeid med urfolksspråk
NbAiLab har et dedikert prosjekt for
samisk språkteknologi
som dekker både talegjenkjenning (ASR) og talesyntese (TTS) for
nordsamisk og lulesamisk. Med 137 millioner ord nordsamisk i
Aurora-datasettet får også tekstmodellene en viss samisk kompetanse.
Samiske ASR-modeller (talegjenkjenning)
-
nb-sami-asr-north-parakeet — nordsamisk ASR basert
på NVIDIA NeMo Parakeet
-
nb-sami-asr-north-nemotron — nordsamisk med
Nemotron 3.5-arkitektur
-
nb-sami-asr-nemotron-3.5-streaming — sanntids
samisk talegjenkjenning
-
salmon-whisper — Whisper fintrent for lulesamisk
Samisk TTS (talesyntese)
-
salmon-f5-tts-north-sami — F5-TTS for nordsamisk
tale
-
Live demo: «North Sami Realtime ASR» og «F5 TTS North Sámi» på
Hugging Face Spaces
Samisk språkteknologi er kritisk for bevaring og revitalisering av
urfolksspråk i Norge. NbAiLabs arbeid gjør det mulig å bygge samiske
digitale verktøy — fra diktering og underteksting til talebaserte
grensesnitt og utdanningsressurser.
Komplett oversikt over NbAiLabs modeller og prosjekter
NbAiLab har publisert over 248 modeller. Her er de viktigste
kategoriene:
Tekstgenerering (LLM)
- Borealis 2 26B-A4B (Gemma 4, MoE)
- Borealis-familien 270M–27B (Gemma 3)
- nb-gpt-gemma4 26B (Gemma 4, tett)
- NB-Llama-3.2 (1B og 3B)
Talegjenkjenning (ASR)
- NB-Whisper (norsk, 39M–1.5B)
- Samisk ASR (Parakeet, Nemotron)
- Streaming ASR (sanntid)
Talesyntese (TTS)
- VoxCPM2 (norsk, 2B)
- salmon-f5-tts (nordsamisk)
- NB-TTS-samlingen (20 varianter)
Oversettelse og NLU
- TranslateGemma 4B (bokmål ↔ nynorsk)
- NB-BERT (norsk tekstforståelse)
- RoBERTa NCC (fill-mask)
Viktige datasett fra NbAiLab
-
Aurora 2604 — 47 mrd. ord, hovedkorpus for
Borealis-trening
-
aurora-sft-2606 — instruksjonsdatasett for
SFT-trening
-
NorNE — norsk Named Entity Recognition-datasett
-
maalfrid_parallel — parallellkorpus for offentlig
norsk tekst
-
Norwegian Colossal Corpus (NCC) — tidlig storskala
norsk korpus
-
nb-asr-eval — evalueringsdatasett for norsk
talegjenkjenning
-
bifrost-translation-source-classifier — 2,16 mill.
eksempler for oversettelsesklassifisering
Eksisterende norske modeller
Borealis 2 26B-A4B (NbAiLab)
Neste generasjon i Borealis-familien — en
Mixture of Experts-modell med 26B totale
parametere, men kun 4B aktive under inferens. Bygget på
Gemma 4-arkitekturen med videretrening på Aurora
2604-datasettet (47 milliarder ord, kunnskapsgrense januar 2025)
og SFT på aurora-sft-2606.
- 26B total / 4B aktive parametere (MoE-arkitektur)
- Multimodal: bilde + tekst (Image-Text-to-Text)
-
Norsk-sentrisk: bokmål, nynorsk, dansk, svensk, engelsk og
samisk
-
Assistentoppgaver: skriving, oppsummering, Q&A, resonnering
- Vurdering av norsk skrivestil og kvalitet
- Preview-versjon — ikke fullstendig safety-alignet
-
NB-lisens 1.0 (basert på Apache 2.0 med bruksrestriksjoner)
Se Borealis 2 26B-A4B på Hugging Face →
nb-gpt-gemma4 (NbAiLab)
NbAiLabs nyeste modellserie bygget på
Gemma 4-arkitekturen. Inkluderer 26B multimodal
instruksjonsmodell med Aurora SFT-trening, samt mindre varianter
(e4b, e2b) med hyppige oppdateringer gjennom 2026.
- 26B multimodal (Image-Text-to-Text) som flaggskip
- Basert på Google Gemma 4 med norsk fintilpasning
- Instruksjonsvariant med Aurora SFT-trening
- Flere størrelser for ulike bruksscenarier
- Aktiv utvikling — nye versjoner regelmessig
Se nb-gpt-gemma4 26B på Hugging Face →
TranslateGemma 4B (NbAiLab)
Spesialisert oversettelsesmodell for
bokmål ↔ nynorsk, bygget på Gemma-arkitekturen.
Optimalisert for høykvalitets norsk oversettelse mellom
målformene.
- 4B-størrelse — kan kjøres på forbrukerhardware
- Spesialtrent for norsk målformkonvertering
- Nyttig for offentlig sektor, media og utdanning
- Åpen modell fra NbAiLab
Se TranslateGemma 4B på Hugging Face →
Borealis-familien (NbAiLab)
Nasjonalbiblioteket (NbAiLab) har lansert
Borealis som en komplett serie åpne språkmodeller
bygget på Gemma 3-arkitekturen. Familien spenner
fra 270M til 27B parametere, med multimodal støtte (bilde + tekst)
fra 4B og opp.
-
270M og 1B — tekstgenerering, kjører på CPU og
edge-enheter
-
4B og 12B — multimodal (Image-Text-to-Text),
god balanse for norsk chatbot og analyse
-
27B — fullskala norsk assistent med
oppsummering, Q&A, resonnering og vurdering av norsk
skrivestil
-
Instruksjons-varianter (instruct-preview) og åpne base-modeller
(borealis-open)
-
Tilgjengelig i GGUF (llama.cpp/Ollama), MLX (Apple Silicon) og
safetensors
- Støtter bokmål, nynorsk og samiske språk
-
Trent med Aurora SFT-datasett fra Nasjonalbibliotekets samlinger
-
Gemma-lisens — egnet for forskning og mange produksjonsscenarier
Se Borealis 27B på Hugging Face →
NB-Llama-3.2 (NbAiLab)
Nye Llama 3.2-baserte modeller i 1B og 3B-størrelse, lansert april
2026. Optimalisert spesifikt for norsk tekst med bred nordisk
språkdekning.
- 1B-varianten kjører på CPU og enkle edge-enheter
-
3B-varianten gir godt kompromiss for chatbot og klassifisering
- Sterk flerspråklig støtte på nordiske språk
- Bygget på Meta Llama 3.2-arkitekturen
Last ned fra NbAiLab på Hugging Face →
NorMistral (NORA.LLM)
NorMistral er en serie norsk-tilpassede modeller
i NORA.LLM-initiativet. Finnes i 7B-warm, 11B og
11B-thinking-varianter. Nytt i 2026: NorMistral-11B-thinking med
styrket resonnering og GGUF-distribusjon.
-
NorMistral-7B-warm: praktisk størrelse for produksjon og
eksperimentering
-
NorMistral-11B-long: utvidet kontekst for lengre dokumenter
-
NorMistral-11B-thinking: reasoning-variant med GGUF for lokal
kjøring
- Kontinuerlig trent på store norske tekstkorpus
- Åpne vekter via Hugging Face
NORA.LLM-modeller på Hugging Face →
NorwAI (NTNU)
NorwAI er et modellspor fra NTNU, tilgjengelig i
Llama 2- og Mistral-arkitekturer. 7B og 45B-varianter er i
produksjonsdrift for forskning og nordisk bedriftsbruk.
- 7B: god balanse for egenhosting på standard server-GPU
- 45B: høyere kapasitet for krevende norske oppgaver
- Rettet mot akademia og nordiske industrimiljøer
- Åpent tilgjengelig for forskning
NorwAI på Hugging Face →
Viking (AI Sweden / Nordisk samarbeid)
Viking er en flerspråklig nordisk modellserie
utviklet av AI Sweden i samarbeid med nordiske partnere. Modellene
har sterk norsk, svensk, dansk og finsk støtte med flere
størrelser tilgjengelig.
- Flerspråklig nordisk modell med sterk norskstøtte
- Flere størrelser fra 7B til 33B
- Åpent tilgjengelig for forskning og kommersielt bruk
- Samarbeid mellom AI Sweden, WASP og nordiske aktører
AI Sweden-modeller på Hugging Face →
Nordisk samarbeid og ScandEval
Norsk KI-utvikling skjer ikke i isolasjon. Skandinaviske
samarbeidsmodeller som ScandEval-benchmarks,
GPT-SW3 (AI Sweden) og nordiske tekstkorpus
styrker hele regionen.
- ScandEval: delte evalueringsrammeverk for nordiske språk
- GPT-SW3: skandinavisk modellserie fra AI Sweden
- Felles datasett og korpus på tvers av landegrenser
-
Norsk deltagelse i europeiske KI-initiativ (HPLT, OPUS, EuroHPC)
Nordisk talegjenkjenning (ASR)
Nordiske små modeller for tale-til-tekst har utviklet seg raskt.
NB-Whisper dekker norsk, mens hviske-serien fra syv.ai setter nye
rekorder for dansk — begge med varianter små nok for edge og
nettleser.
NB-Whisper (NbAiLab)
Norsk talegjenkjenning bygget på OpenAI Whisper-arkitekturen,
trent på 20 000 timer norsk tale fra NRK,
Stortinget, lydbøker og Nasjonalbibliotekets samlinger.
-
Tiny (39M) — kjører på CPU, egnet for edge og
rask prototyping
-
Base (73M) og Small (244M) —
god balanse
- Medium (769M) — sterkere nøyaktighet
-
Large (1.5B) — beste kvalitet for norsk
transkribering
- Støtter bokmål, nynorsk og delvis engelsk
- Semantiske varianter med bedre tegnsetting og grammatikk
- CC BY 4.0-lisens — fri bruk også kommersielt
Se NB-Whisper Large på Hugging Face →
hviske-v5-tiny (syv.ai)
Dansk ASR-modell med bare 263M parametere,
distillert fra et 2.1B-ensemble. 8× mindre enn læreren, men slår
den på FTSpeech-benchmarket (7.15 WER). Ikke basert på Whisper —
bruker egen cohere_asr-arkitektur.
- 320× sanntid på RTX 3090, 87× på Apple M4 (MLX int4)
-
Kjører i nettleser via WebGPU — ingen data sendes til server
- 13.84 WER gjennomsnitt på fem danske datasett
- Tilgjengelig i GGUF (160 MB q4_k), MLX og ONNX
- Svært relevant for norsk pga. språklikhet dansk–norsk
- CC BY-NC 4.0 (kommersiell bruk krever separat lisens)
Se hviske-v5-tiny på Hugging Face →
hviske-v5.3 (syv.ai)
Flaggskipmodellen i hviske-serien —
2B parametere med Conformer encoder-decoder.
Trent på CoRal v3-datasettet for dansk opplesning og samtale.
Laveste CER på begge kategorier, slår Whisper large-v3 og
kommersielle løsninger.
-
425× sanntid — 60 minutter tale på 8.5 sekunder (RTX 3090)
- 9.01% WER opplesning, 19.21% WER samtale (beam search)
- Slår OpenAI gpt-4o-transcribe og ElevenLabs på dansk
- vLLM-støtte med OpenAI-kompatibelt API-endepunkt
- CC BY-NC 4.0-lisens
Se hviske-v5.3 på Hugging Face →
Samisk ASR (NbAiLab)
NbAiLab utvikler også talegjenkjenning for
nordsamisk og lulesamisk, basert
på NVIDIA NeMo Parakeet og Nemotron-arkitekturer. Under aktiv
utvikling 2026.
- nb-sami-asr-north-parakeet — nordsamisk modell
- nb-sami-asr-north-nemotron — streaming-variant
- salmon-whisper — Whisper fintrent for lulesamisk
- Viktig for bevaring av samisk språk og kultur
Se samisk ASR på NbAiLab →
Hva er på vei
Borealis neste generasjon
Med Borealis-familien allerede lansert i 270M–27B størrelser,
arbeider NbAiLab videre med forbedret instruksjonstuning, bedre
multimodal støtte og bredere dekningsgrad av norsk dialekt og
samisk.
- Fra preview til fullversjon med safety-alignment
- Forbedret multimodal (bilde + tekst) for alle størrelser
- Utvidet samisk språkdekning og dialektstøtte
- Potensielt Gemma 4-baserte Borealis-varianter
Fintrening og domenespesialisering
Det norske fagmiljøet jobber med fintrente varianter for helse,
jus og offentlig forvaltning — der fagspråk og nøyaktighet er
kritisk.
- Norsk medisinsk NLP (Helse Sør-Øst og NTNU)
- Juridisk norsk fra lovdata og domstolssystemet
- Offentlig forvaltningsspråk (NAV, Skatteetaten)
Infrastruktur og compute
Tilgang på norsk og nordisk beregningsinfrastruktur er en
forutsetning for å trene og drifte konkurransedyktige modeller i
Europa.
-
LUMI-supercomputeren (Finland) brukes av norske
forskningsmiljøer
-
Sigma2/NRIS gir norske akademikere tilgang til GPU-ressurser
- Europeisk EuroHPC-initiativ styrker nordisk kapasitet
Digital suverenitet som drivkraft
Offentlig sektor og regulerte bransjer etterspør modeller som kan
driftes innenfor norsk/europeisk jurisdiksjon. Dette driver
investeringer i norske og nordiske modellspor fremover.
- GDPR og personvernkrav favoriserer lokal drift
- Offentlige anskaffelsesregler presser mot åpne modeller
- Helsesektoren trenger suverene løsninger for pasientdata
Hvorfor små modeller er viktige
-
De presterer ofte svært godt på avgrensede språkoppgaver med
skreddersydde data — hviske-v5-tiny (263M) slår sin 2.1B-lærer på
dansk tale.
-
De gir bedre kontroll over dataflyt, jurisdiksjon og personvernkrav.
-
De har lavere kostnad, lavere latens og kan kjøre på enklere
maskinvare — NB-Whisper Tiny (39M) kjører på ren CPU.
-
De kan kjøre i nettleser via WebGPU/ONNX uten å sende data til
server.
-
De fungerer godt som komponenter i større KI-systemer sammen med
større modeller.
-
Borealis 270M og 1B gir norsk tekstgenerering på edge-enheter og
bærbare maskiner uten GPU.
Strukturerte språkoppgaver
Små modeller er godt egnet for klassifisering, NER for norske navn,
sentimentanalyse, oppsummering og uttrekk av nøkkelinformasjon.
De er også nyttige for oversettelse mellom bokmål og nynorsk, og på
sikt mellom norske og samiske språkressurser.
Domenespesifikke fagsystemer
Fintrente modeller kan bli svært presise innen jus, helse, offentlig
forvaltning, finans og teknisk dokumentasjon.
Når språkmodellen trenes på relevant fagspråk, øker treffsikkerhet
og nytte i daglige arbeidsprosesser.
Digital suverenitet og personvern
Lokal drift gjør det mulig å behandle sensitive data uten å sende
informasjon til utenlandske skytjenester.
Dette er særlig relevant for helsesektor, rettsvesen, forsvar,
offentlig sektor og kritisk infrastruktur.
Kostnad og volum
Små modeller har lavere driftskostnad og responstid, noe som gjør
dem egnet for høyvolumoppgaver som tagging, metadata-generering og
batch-prosessering av store tekstsamlinger.
De passer også godt i chatboter, kundeservice og produkter der
eksterne API-kall blir for dyrt eller for tregt.
Rolle i større KI-arkitektur
RAG-pipelines
Spørsmålsomskriving, reranking og svarvalidering på norsk før
endelig respons sendes til brukeren.
Tale-til-tekst
NB-Whisper og hviske gir lokal transkribering av norsk/dansk tale
som input til videre prosessering i KI-systemer.
Agentflyt
Ruting av forespørsler, verktøyvalg og enkel resonnering i
flertrinns systemer med krav om rask respons.
Kvalitet på norsk
Kontroll av språkføring, klart språk og målform for bokmål og
nynorsk i generert tekst.
Kulturarv, forskning og utdanning
-
Forbedret søk og gjenfinning i digitaliserte samlinger hos
kulturinstitusjoner.
-
OCR-etterbehandling, transkribering og automatisk metadata for store
historiske tekstkorpus.
-
Åpne modeller gir forskere og studenter mulighet til å
eksperimentere, inspisere og reprodusere resultater.
-
Språkforskning styrkes gjennom tilgang til modeller for dialekter,
språkstruktur og språkutvikling over tid.
Edge-distribusjon og bærekraft
De minste modellvariantene kan kjøres lokalt på bærbare maskiner,
arbeidsstasjoner og enkelte mobile enheter. Dette gjør løsningene mer
robuste i felt, ved ustabil nettilgang eller i isolerte miljøer.
Samtidig gir små modeller betydelig lavere energiforbruk per
forespørsel enn svært store modeller, og kan derfor være et mer
bærekraftig valg når oppgaven ikke krever en generell frontier-modell.
Oppsummering
Borealis og andre små, spesialiserte norske språkmodeller er ikke en
erstatning for alle store modeller. De fyller en komplementær rolle:
skreddersydd språkstøtte, lokal kontroll, lavere kostnad og raskere
drift i mange praktiske anvendelser.