Digitale lagre af gamle bøger

På Det Kongelige Bibliotek har de været i gang i lang tid med at digitalisere de mange gamle bøger i samlingen. ComON tog en tur ind i Den Sorte Diamant for at se på, hvordan de gør.

»Kvalitetsmæssigt er vi nogle af de førende. Kvantitativt er vi ikke,«fortæller it-konsulent Hamid Mehrabi.

Sektionsleder Britta Lorckmann supplerer:
»Vi har det problem, at dansk er et lille sprogområde. Så modsat engelsk, er efterspørgslen på verdensplan af danske materialer mindre.«

Det betyder at der er færre om at betale, og for Afdelingen for Digital Produktion og Udvikling er det i sidste ende et spørgsmål om økonomi, hvor meget der kan blive skannet.

24 kilometer hylder

Det Kongelige Bibliotek har omkring 24 kilometer hylder af danske samlinger, med stort set alt, hvad der er skrevet og trykt i Danmark siden 1700-tallet.

»Vi ville gerne starte fra A til Z, men det har vi ikke midlerne til,« fortæller Britta Lorckmann.

Derfor er det de forskellige afdelinger på biblioteket, der afgør hvad de vil have scannet først. Og så står Afdelingen for Digital Produktion og Udvikling for at scanne materialerne i samarbejdet med afdelingerne.

Men det er ikke altid materialernes beskaffenhed, der afgør hvor i køen de kommer til. Et legat kan gøre, at et nyt projekt bliver startet, selv om materialerne måske ikke er i den store fare for forvanskelse. Det handler jo om økonomi.

En stor skrivebordsscanner

Selve scanningen af materialerne foregår kun på biblioteket. Materialerne må ikke forlade biblioteket, så at have en tredje part til at udføre det manuelle arbejde er udelukket.

Maskinen ligner en større udgave af en skrivebordsscanner. Men der stopper sammenligningerne også. Det Kongelige Biblioteks scanner er en dyr sag, som kan give den høje opløsning, som langtidsbevaringen kræver.

Bøgerne bliver scannet til højopløsnings tiff-filer, og derefter udsat for OCR, Optical Character Recognition. Det er et system, der kan genkende bogstaver og omskrive indscanningerne til et tekst-dokument. Derved bliver det muligt at søge i teksterne.

Som eksempel fremhæver Britta Lorckmann Arkiv for Dansk Litteratur. Her er den danske litteratur, der er fri for copyright, såkaldt "public domain," lagt ud og gjort tilgængelig online.

Man kan søge i de OCR-genererede tekster, men endnu vigtigere, er det muligt at se scannet af den originale bog. På den måde kan brugerne sende en fejlmeddelelse.

Alle skal kunne læse med

Tilgængelighed for offentligheden er et af de største kriterier for arbejdet i Digital Udvikling og Produktion. Tidligere var der et modsætningsforhold i arbejdet i afdelingen.

Før bredbåndsforbindelser og hurtige computere var man nødt til at afveje forholdet mellem de store filer, der skal bruges til langstidsbevaring, samtidig med at lave billeder, der kunne fremvises over nettet.

Men udviklingen har heldigvis indhentet det, og i dag er det intet problem at lagre store filer, og samtidig have dem tilgængelige for offentligheden.

Hurtigere og billigere

»Alt er blevet hurtigere og billigere, og det har udryddet det modsætningsforhold,« forklarer Hamid Mehrabi.
I dag er deres scanner så effektiv, at kapaciteten er oppe på 40,000 sider om dagen, i forhold til de 400 billeder, de kunne scannne for ti år siden. Og så er opløsningen endda dobbelt så høj.

Tekstgenkendelse er ikke perfekt

Hver gang Digital Udvikling og Produktion starter et nyt projekt, bliver der oprettet en ordbog. Det fungerer sådan, at OCR-programmet så kan checke de ord, den har læst, op mod ordbogen.

»Et af problemerne med OCR er, at i gamle dage havde man ikke retstavning. Så man kan ikke bare matche ordene op med en ordbog. Så ville det gå helt galt,« forklarer Britta Lorckmann.

Men at lave en begrænset ordbog for enkelte tekster kan hjælpe OCR-programmet med at lave mere korrekte tekster. I afdelingen sigter de efter at have korrekthed på 99,8 procent.

»Hvis du skal have 100 procent korrekthed, bliver du nødt til at læse manuel korrektur på det hele. Og det er der ikke økonomi til. « fortæller Britta Lorckmann videre.

I stedet foretager afdelingen stikprøver. Hvis der er for mange fejl, bliver OCR-teksten brugt til at lave en PDF-fil. I denne fil bliver teksten lagt ind med scannet ovenpå. På den måde er teksten stadig søgbar, men brugeren ser kun scannet af de originale sider, ikke at OCR-processen har læst nogle bogstaver forkert. Sammen med brugerrettelserne er det så muligt at få korrektur på de tekster hen ad vejen.

»Vi går efter at få automatiserede processer med høj kvalitet, for manuelt arbejde er det dyre arbejde,« afslutter Britta Lorckmann.

Læses lige nu
    Computerworld Events

    Vi samler hvert år mere end 6.000 deltagere på mere end 70 events for it-professionelle.

    Ekspertindsigt – Lyt til førende specialister og virksomheder, der deler viden om den nyeste teknologi og de bedste løsninger.
    Netværk – Mød beslutningstagere, kolleger og samarbejdspartnere på tværs af brancher.
    Praktisk viden – Få konkrete cases, værktøjer og inspiration, som du kan tage direkte med hjem i organisationen.
    Aktuelle tendenser – Bliv opdateret på de vigtigste dagsordener inden for cloud, sikkerhed, data, AI og digital forretning.

    Andre events | Kongens Lyngby

    Årets CIO 2026

    Vi samler Danmarks stærkeste digitale ledere til en dag med viden og visioner. Årets CIO 2026 fejrer 21 års jubilæum, og NEXT CIO sætter spotlight på næste generation. Deltag og bliv inspireret til at forme fremtidens strategi og eksekvering.

    Digital transformation | Hellerup

    Roundtable: Stærkere data og skarpere beslutninger i en AI-æra

    AI kræver data, ledelsen kan stole på. Computerworld samler digitale ledere til en fortrolig rundbordssamtale om datagrundlag, beslutninger og skalering af AI i organisationen. Få konkrete erfaringer og nye perspektiver. Ansøg om en plads.

    Sikkerhed | Klampenborg

    CISO Challenges 2026 - København

    Computerworld stiller skarpt på, hvordan du som CISO eller sikkerhedsansvarlig, kan leve op til alle krav om sikkerhed og risikostyring, gennem dialog og erfaringsudveksling. Gennem både korte oplæg og rundbordsdiskussioner, vil du blive klædt på...

    Se alle vores events inden for it

    Navnenyt fra it-Danmark

    Renewtech ApS har pr. 1. marts 2026 ansat Emil Holme Fisker som Customer Service Specialist. Han skal især beskæftige sig med at levere høj kvalitets kundeservice og hjælpe Renewtechs kunder med at få de rette løsninger til deres behov. Han kommer fra en stilling som Key Account Manager hos Camro A/S. Han er uddannet som salgselev hos Camro A/S. Han har tidligere beskæftiget sig med at udvikle gode kunderelationer, opsøgende salg og udvikling af salgsaktiviteter. Nyt job

    Emil Holme Fisker

    Renewtech ApS

    Immeo har pr. 1. marts 2026 ansat Theo Lyngaa Hansen som Consultant. Han kommer fra en stilling som Data Manager hos IDA. Han er uddannet i Business Administration & Data Science. Nyt job
    Pinksky har pr. 1. maj 2026 ansat Alexander Skou Henkel, 39 år,  som Rådgivende konsulent. Han skal især beskæftige sig med optimering af forretningsprocesser i Microsoft platformen. Han kommer fra en stilling som IT forretningskonsulent hos Evobis ApS. Han har tidligere beskæftiget sig med forretningsudvikling i Microsoft platformen. Nyt job
    Elbek & Vejrup A/S har pr. 1. juni 2026 ansat Mikkel Bernt Buchvardt som AI Architect & Product Manager. Han skal især beskæftige sig med udviklingen af AI-Services og AI-Agenter i og omkring Business Central. Han kommer fra en stilling som Lead Data & Analytics hos IBM. Han er uddannet MSc. i softwareudvikling fra ITU. Han har tidligere beskæftiget sig med Data og BI hos KMD og Seges Innovation. Nyt job

    Mikkel Bernt Buchvardt

    Elbek & Vejrup A/S