Digitale lagre af gamle bøger

På Det Kongelige Bibliotek har de været i gang i lang tid med at digitalisere de mange gamle bøger i samlingen. ComON tog en tur ind i Den Sorte Diamant for at se på, hvordan de gør.

»Kvalitetsmæssigt er vi nogle af de førende. Kvantitativt er vi ikke,«fortæller it-konsulent Hamid Mehrabi.

Sektionsleder Britta Lorckmann supplerer:
»Vi har det problem, at dansk er et lille sprogområde. Så modsat engelsk, er efterspørgslen på verdensplan af danske materialer mindre.«

Det betyder at der er færre om at betale, og for Afdelingen for Digital Produktion og Udvikling er det i sidste ende et spørgsmål om økonomi, hvor meget der kan blive skannet.

24 kilometer hylder

Det Kongelige Bibliotek har omkring 24 kilometer hylder af danske samlinger, med stort set alt, hvad der er skrevet og trykt i Danmark siden 1700-tallet.

»Vi ville gerne starte fra A til Z, men det har vi ikke midlerne til,« fortæller Britta Lorckmann.

Derfor er det de forskellige afdelinger på biblioteket, der afgør hvad de vil have scannet først. Og så står Afdelingen for Digital Produktion og Udvikling for at scanne materialerne i samarbejdet med afdelingerne.

Men det er ikke altid materialernes beskaffenhed, der afgør hvor i køen de kommer til. Et legat kan gøre, at et nyt projekt bliver startet, selv om materialerne måske ikke er i den store fare for forvanskelse. Det handler jo om økonomi.

En stor skrivebordsscanner

Selve scanningen af materialerne foregår kun på biblioteket. Materialerne må ikke forlade biblioteket, så at have en tredje part til at udføre det manuelle arbejde er udelukket.

Maskinen ligner en større udgave af en skrivebordsscanner. Men der stopper sammenligningerne også. Det Kongelige Biblioteks scanner er en dyr sag, som kan give den høje opløsning, som langtidsbevaringen kræver.

Bøgerne bliver scannet til højopløsnings tiff-filer, og derefter udsat for OCR, Optical Character Recognition. Det er et system, der kan genkende bogstaver og omskrive indscanningerne til et tekst-dokument. Derved bliver det muligt at søge i teksterne.

Som eksempel fremhæver Britta Lorckmann Arkiv for Dansk Litteratur. Her er den danske litteratur, der er fri for copyright, såkaldt "public domain," lagt ud og gjort tilgængelig online.

Man kan søge i de OCR-genererede tekster, men endnu vigtigere, er det muligt at se scannet af den originale bog. På den måde kan brugerne sende en fejlmeddelelse.

Alle skal kunne læse med

Tilgængelighed for offentligheden er et af de største kriterier for arbejdet i Digital Udvikling og Produktion. Tidligere var der et modsætningsforhold i arbejdet i afdelingen.

Før bredbåndsforbindelser og hurtige computere var man nødt til at afveje forholdet mellem de store filer, der skal bruges til langstidsbevaring, samtidig med at lave billeder, der kunne fremvises over nettet.

Men udviklingen har heldigvis indhentet det, og i dag er det intet problem at lagre store filer, og samtidig have dem tilgængelige for offentligheden.

Hurtigere og billigere

»Alt er blevet hurtigere og billigere, og det har udryddet det modsætningsforhold,« forklarer Hamid Mehrabi.
I dag er deres scanner så effektiv, at kapaciteten er oppe på 40,000 sider om dagen, i forhold til de 400 billeder, de kunne scannne for ti år siden. Og så er opløsningen endda dobbelt så høj.

Tekstgenkendelse er ikke perfekt

Hver gang Digital Udvikling og Produktion starter et nyt projekt, bliver der oprettet en ordbog. Det fungerer sådan, at OCR-programmet så kan checke de ord, den har læst, op mod ordbogen.

»Et af problemerne med OCR er, at i gamle dage havde man ikke retstavning. Så man kan ikke bare matche ordene op med en ordbog. Så ville det gå helt galt,« forklarer Britta Lorckmann.

Men at lave en begrænset ordbog for enkelte tekster kan hjælpe OCR-programmet med at lave mere korrekte tekster. I afdelingen sigter de efter at have korrekthed på 99,8 procent.

»Hvis du skal have 100 procent korrekthed, bliver du nødt til at læse manuel korrektur på det hele. Og det er der ikke økonomi til. « fortæller Britta Lorckmann videre.

I stedet foretager afdelingen stikprøver. Hvis der er for mange fejl, bliver OCR-teksten brugt til at lave en PDF-fil. I denne fil bliver teksten lagt ind med scannet ovenpå. På den måde er teksten stadig søgbar, men brugeren ser kun scannet af de originale sider, ikke at OCR-processen har læst nogle bogstaver forkert. Sammen med brugerrettelserne er det så muligt at få korrektur på de tekster hen ad vejen.

»Vi går efter at få automatiserede processer med høj kvalitet, for manuelt arbejde er det dyre arbejde,« afslutter Britta Lorckmann.

Læses lige nu

    Forsvarsministeriets Materiel- og Indkøbsstyrelse

    Nye kolleger søges til IT Stab i Forsvaret

    Nordjylland

    Statens IT

    IT-projektleder hos Statens It

    Midtjylland

    KMD A/S

    Compliance Officer

    Københavnsområdet

    Indenrigs- og Sundhedsministeriet

    IT/AI-projektleder til Indenrigs- og Sundhedsministeriets departement

    Københavnsområdet

    Event: Computerworld Cloud & AI Festival 2026

    Digital transformation | Ballerup

    Eksplosiv udvikling i cloud og AI kræver overblik og viden. Computerworld samler 3.000 it-professionelle, 70+ leverandører og 120+ talere om AI, infrastruktur, data, compliance og sikkerhed. To dage med viden og netværk. Tilmeld dig nu.

    16 & 17 september 2026 | Gratis deltagelse

    Navnenyt fra it-Danmark

    Jakob Dirksen, SVP, Nordic Customer Delivery & Operations hos GlobalConnect, er pr. 1. maj 2026 forfremmet til EVP, Infrastructure Delivery & Operations. Han skal fremover især beskæftige sig med at lede Infrastructure Delivery & Operations, der har til opgave at drive og udvikle fibernetværket på tværs af virksomheden. Forfremmelse

    Jakob Dirksen

    GlobalConnect

    Pentos har pr. 2. juni 2025 ansat Jonas Kyhnau som Seniorkonsulent. Han skal især beskæftige sig med at rådgive virksomheder om HR digitalisering og implementering af SAP SuccessFactors og SmartRecruiters. Han kommer fra en stilling som Seniorkonsulent og PMO lead hos Gavdi. Han er uddannet Cand.merc Human Resource Management fra Copenhagen Business School. Han har tidligere beskæftiget sig med med Onboarding, Employee Central (Core HR). Nyt job

    Jonas Kyhnau

    Pentos

    Den danske eID-virksomhed Idura har pr. 1. april 2026 ansat Kari Lehtimäki som Country Manager. Han skal især beskæftige sig med at styrke kendskabet til Iduras løsninger i Finland samt fremme samarbejdet med økosystemet omkring det finske Trust Network. Han kommer fra en stilling som Salgschef hos Telia Finland. Han er uddannet uddannet civilingeniør (M.Sc. Tech.) og medbringer ledelse, markedsindsigt og praktisk erfaring. Han har tidligere beskæftiget sig med salg og forretningsudvikling inden for Telias trust services-forretning. Nyt job

    Kari Lehtimäki

    Den danske eID-virksomhed Idura