Artikel top billede

Dansk projekt: Udklæk brugbar data fra tekstfiler

Tema: En dansker er sammen med en gruppe spaniere i gang med at udvikle et system, der finder sammenhænge mellem tal i virksomhedens datawarehouse og tekstdokumenter.

I en virksomhed falder salgstallet i et bestemt marked, men måske findes forklaringen ikke i ens taldata, men i en e-mail, virksomheden tidligere har modtaget.

Sammen med spanske kolleger har Torben Bach Pedersen fra Center for Dataintensive Systemer på Aalborg Universitet i denne uge fremvist en prototype på et system, der kan finde forklaringer på dataudsving i "bløde" tekstkilder.

Det skete på en international konference for databaser i Tyrkiet, hvor der ifølge Torben Bach Pedersen var stor interesse for at høre om teknologien ved fremvisningen onsdag og torsdag.

Multidimensionelle data

Med OLAP – online analytical processing – kan business intelligence-programmer analysere datawarehouses, hvor data er "bundet til hinanden".

Man arbejder med multidimensionelle data, hvor dimensionerne for eksempel kan være måneder, typer, kunder, produkter og regioner.

Altså kan man finde meget snævre sammenhænge i tallene - men én dimension har manglet.

"Vi ser i virksomhederne, at de har deres datawarehouse og utrolig meget taldata fra regnskaber og så videre. Og så har de en masse tekst-information. Det kan både være fra eksterne kilder og interne dokumenter. Men det er svært at binde data og tekst sammen, så man kan finde sammenhænge på tværs af informationstypen," siger Torben Bach Pedersen.

Sammenhænge mellem aktiekurser og Irak

Prototypen er blevet testet ved at lade programmet hente data for verdens aktiemarkeder. Samtidig har gruppen bag indsat artikler fra erhvervsaviser.

Torben Bach Pedersen og kollegerne har så søgt efter "Iraq" i programmet. Derefter har den fundet de markedsudsving, der ifølge erhvervsaviserne har haft noget med Irak at gøre.

Den søger altså ikke bare efter ordet "Iraq", men også hvor relevant ordet er i sammenhængen.

Den ser blandt andet på, hvilke værdier, som artiklen nævner, og som den kan genkende i data fra datawarehouset.

"Det viser sig, at det traditionelt er det japanske marked, der er mest følsomt over for uro i Irak på grund af Japans olieafhængighed," siger Torben Bach Pedersen.

Derimod var det tyske aktiemarked ikke særligt påvirket, og programmet fandt tekstbidder, der fortalte, at Tyskland fik mindre end to procent af sin olie fra Irak og Kuwait.

Ingen textmining i Danmark endnu

Den dansk/spanske gruppe er ikke den eneste, der arbejder med at grave efter årsager og konsekvenser i tekster og ikke kun i traditionelle datawarehouses.

Ernst Kier er salgschef i det nordiske BI-konsulenthus Platon og fortæller, at især SAS Institute og SPSS arbejder med den relaterede textminingsteknologi.

Ved textmining er teksten en selvstændig datakilde, hvor det måske nok er muligt at finde sammenhænge mellem kurser og tekster, men du kan ikke søge automatisk i alle dimensioner på en gang.

Efterspørgslen er dog stadig efter den traditionelle datamining, og Platon har derfor slet ikke haft nogle textminingsopgaver.

"Der skal først være en businesscase, og derfor er nogle nødt til at løbe forrest. Det er fornuftigt, at universiteter hjælper med at løbe det i gang, og det skal nok blive stort på et tidspunkt," siger Ernst Kier.

Det dansk/spanske system henter for nuværende dokumenter ind i et dokument-warehouse via XML, men planen er på længere sigt, at det kan finde kilder på hele internettet via søgemaskiner.




Brancheguiden
Brancheguide logo
Opdateres dagligt:
Den største og
mest komplette
oversigt
over danske
it-virksomheder
Hvad kan de? Hvor store er de? Hvor bor de?
Konica Minolta Business Solutions Denmark A/S
Salg af kopimaskiner, digitale produktionssystemer og it-services.

Nøgletal og mere info om virksomheden
Skal din virksomhed med i Guiden? Klik her

Kommende events
OT og IT: Modernisér produktionen og byg sikker bro efter et årelangt teknologisk efterslæb

Moderne produkter skal have mere end strøm for at fungere – og deres navlestreng skal ikke klippes når de forlader fabrikshallen. På denne konference kan du derfor lære mere om hvordan du får etableret det sikre setup når der går IT i OT.

30. april 2024 | Læs mere


Roundtable for sikkerhedsansvarlige: Hvordan opnår man en robust sikkerhedsposition?

For mange virksomheder har Zero Trust og dets principper transformeret traditionelle tilgange til netværkssikkerhed, hvilket har gjort det muligt for organisationer at opnå hidtil usete niveauer af detaljeret kontrol over deres brugere, enheder og netværk - men hvordan implementerer man bedst Zero Trust-arkitekturer i et enterprise set up? Og hvordan muliggør Zero Trust-arkitekturen, at organisationer opnår produktivitetsfordele med AI-værktøjer samtidig med, at de forbliver sikre i lyset af fremvoksende trusler?

01. maj 2024 | Læs mere


ERP-trends 2024

Bliv derfor inspireret til, hvordan du kan optimere dine systemer og processer når af nogle af de fremmeste eksperter på ERP-markedet dele deres iagttagelser af det aktuelle marked og vurderinger af, hvad vi har i vente de kommende 3-5 år. Vi sætter også fokus på, hvordan udviklingen kommer til at påvirke din organisation, hvordan du bedst forbereder og planlægger ERP-indsatsen og om, hvilke faldgruber du skal være opmærksom på.

02. maj 2024 | Læs mere