Digitale lagre af gamle bøger

På Det Kongelige Bibliotek har de været i gang i lang tid med at digitalisere de mange gamle bøger i samlingen. ComON tog en tur ind i Den Sorte Diamant for at se på, hvordan de gør.

»Kvalitetsmæssigt er vi nogle af de førende. Kvantitativt er vi ikke,«fortæller it-konsulent Hamid Mehrabi.

Sektionsleder Britta Lorckmann supplerer:
»Vi har det problem, at dansk er et lille sprogområde. Så modsat engelsk, er efterspørgslen på verdensplan af danske materialer mindre.«

Det betyder at der er færre om at betale, og for Afdelingen for Digital Produktion og Udvikling er det i sidste ende et spørgsmål om økonomi, hvor meget der kan blive skannet.

24 kilometer hylder

Det Kongelige Bibliotek har omkring 24 kilometer hylder af danske samlinger, med stort set alt, hvad der er skrevet og trykt i Danmark siden 1700-tallet.

»Vi ville gerne starte fra A til Z, men det har vi ikke midlerne til,« fortæller Britta Lorckmann.

Derfor er det de forskellige afdelinger på biblioteket, der afgør hvad de vil have scannet først. Og så står Afdelingen for Digital Produktion og Udvikling for at scanne materialerne i samarbejdet med afdelingerne.

Men det er ikke altid materialernes beskaffenhed, der afgør hvor i køen de kommer til. Et legat kan gøre, at et nyt projekt bliver startet, selv om materialerne måske ikke er i den store fare for forvanskelse. Det handler jo om økonomi.

En stor skrivebordsscanner

Selve scanningen af materialerne foregår kun på biblioteket. Materialerne må ikke forlade biblioteket, så at have en tredje part til at udføre det manuelle arbejde er udelukket.

Maskinen ligner en større udgave af en skrivebordsscanner. Men der stopper sammenligningerne også. Det Kongelige Biblioteks scanner er en dyr sag, som kan give den høje opløsning, som langtidsbevaringen kræver.

Bøgerne bliver scannet til højopløsnings tiff-filer, og derefter udsat for OCR, Optical Character Recognition. Det er et system, der kan genkende bogstaver og omskrive indscanningerne til et tekst-dokument. Derved bliver det muligt at søge i teksterne.

Som eksempel fremhæver Britta Lorckmann Arkiv for Dansk Litteratur. Her er den danske litteratur, der er fri for copyright, såkaldt "public domain," lagt ud og gjort tilgængelig online.

Man kan søge i de OCR-genererede tekster, men endnu vigtigere, er det muligt at se scannet af den originale bog. På den måde kan brugerne sende en fejlmeddelelse.

Alle skal kunne læse med

Tilgængelighed for offentligheden er et af de største kriterier for arbejdet i Digital Udvikling og Produktion. Tidligere var der et modsætningsforhold i arbejdet i afdelingen.

Før bredbåndsforbindelser og hurtige computere var man nødt til at afveje forholdet mellem de store filer, der skal bruges til langstidsbevaring, samtidig med at lave billeder, der kunne fremvises over nettet.

Men udviklingen har heldigvis indhentet det, og i dag er det intet problem at lagre store filer, og samtidig have dem tilgængelige for offentligheden.

Hurtigere og billigere

»Alt er blevet hurtigere og billigere, og det har udryddet det modsætningsforhold,« forklarer Hamid Mehrabi.
I dag er deres scanner så effektiv, at kapaciteten er oppe på 40,000 sider om dagen, i forhold til de 400 billeder, de kunne scannne for ti år siden. Og så er opløsningen endda dobbelt så høj.

Tekstgenkendelse er ikke perfekt

Hver gang Digital Udvikling og Produktion starter et nyt projekt, bliver der oprettet en ordbog. Det fungerer sådan, at OCR-programmet så kan checke de ord, den har læst, op mod ordbogen.

»Et af problemerne med OCR er, at i gamle dage havde man ikke retstavning. Så man kan ikke bare matche ordene op med en ordbog. Så ville det gå helt galt,« forklarer Britta Lorckmann.

Men at lave en begrænset ordbog for enkelte tekster kan hjælpe OCR-programmet med at lave mere korrekte tekster. I afdelingen sigter de efter at have korrekthed på 99,8 procent.

»Hvis du skal have 100 procent korrekthed, bliver du nødt til at læse manuel korrektur på det hele. Og det er der ikke økonomi til. « fortæller Britta Lorckmann videre.

I stedet foretager afdelingen stikprøver. Hvis der er for mange fejl, bliver OCR-teksten brugt til at lave en PDF-fil. I denne fil bliver teksten lagt ind med scannet ovenpå. På den måde er teksten stadig søgbar, men brugeren ser kun scannet af de originale sider, ikke at OCR-processen har læst nogle bogstaver forkert. Sammen med brugerrettelserne er det så muligt at få korrektur på de tekster hen ad vejen.

»Vi går efter at få automatiserede processer med høj kvalitet, for manuelt arbejde er det dyre arbejde,« afslutter Britta Lorckmann.

Læses lige nu

    Timengo DPG

    Teknisk Support Lead

    Københavnsområdet

    TD SYNNEX Denmark ApS

    BDM Cisco Security

    Københavnsområdet

    Capgemini Danmark A/S

    Experienced SAP S/4HANA consultant - Business controlling

    Københavnsområdet

    Event: Computerworld Summit 2026 - Aarhus

    Digital transformation | Aarhus C

    Styrk din digitale strategi med konkret brug af AI og ny teknologi. Mød 200 it-professionelle, få indsigter, løsninger og netværk på én dag. Computerworld Summit i Aarhus viser hvordan teknologi skaber forretningsværdi – her og nu.

    21. april 2026 | Gratis deltagelse

    Navnenyt fra it-Danmark

    EG Danmark A/S har pr. 1. december 2025 ansat Søren Jermiin Olesen som Senior Product Manager. Han skal især beskæftige sig med finans- og debitorstyring i det offentlige med ansvar for økonomistyringssystemet EG ØS Indsigt. Han kommer fra en stilling som Product Manager hos KMD A/S. Han er uddannet Cand. oecon. Han har tidligere beskæftiget sig med økonomi bl.a. i Aarhus Kommune og været med til at udvikle NemØkonom før og efter salget til KMD. Nyt job

    Søren Jermiin Olesen

    EG Danmark A/S

    Netip A/S har pr. 1. november 2025 ansat Laura Bøjer som Consultant, GRC & Cybersecurity på afd. Thisted. Hun kommer fra en stilling som Assistant Consultant hos PwC i Hellerup. Hun er uddannet med en kandidat i Business Administration & Information System på Copenhagen Business School. Nyt job

    Laura Bøjer

    Netip A/S

    IT Confidence A/S har pr. 1. oktober 2025 ansat Johan Léfelius som it-konsulent. Han skal især beskæftige sig med med support, drift og vedligeholdelse af kunders it-miljøer samt udvikling af sikre og stabile løsninger. Han kommer fra en stilling som kundeservicemedarbejder hos Telia Company Danmark A/S. Han er uddannet (under uddannelse) som datatekniker med speciale i infrastruktur. Han har tidligere beskæftiget sig med kundeservice, salg og teknisk support. Nyt job

    Johan Léfelius

    IT Confidence A/S

    Danske Spil har pr. 1. oktober 2025 ansat Jesper Krogh Heitmann som Brand Manager for Oddset. Han skal især beskæftige sig med at udvikle og drive brandets strategi og sikre en rød tråd på tværs af alle platforme og aktiviteter. Han kommer fra en stilling som Marketing & Communications Manager hos Intellishore. Nyt job

    Jesper Krogh Heitmann

    Danske Spil