Sådan gør du en scannet PDF søgbar — gratis og på dansk
Sådan gør du en scannet PDF søgbar: UniteDocs lægger et usynligt tekstlag på de sider, der kun er billede. Gratis og lokalt på din pc, på dansk og engelsk — og med ærlige ord om, hvad tekstgenkendelsen ikke kan.

En scannet PDF er et fotografi af papir. Der står bogstaver på siden, men computeren ser kun prikker, og derfor finder Ctrl+F ingenting. For at gøre en scannet PDF søgbar skal en tekstgenkender læse bogstaverne og lægge et usynligt tekstlag oven på billedet. I UniteDocs sker det af sig selv, når du gemmer som PDF: siderne ser ud præcis som før, men nu kan du søge, markere og kopiere. Det er gratis, det kører på din egen pc, og det læser dansk og engelsk.
Situationen kender alle, der sidder med sager. Et medlem kommer med en plastiklomme: ansættelseskontrakten, et par lønsedler, en advarsel og opsigelsen. Det hele bliver kørt gennem kopimaskinen på kontoret og sendt til ens egen mail som én lang PDF. Bagefter skal man finde datoen for advarslen, og så sidder man og bladrer side for side, fordi søgefeltet melder »ingen resultater« — også på ord, man kan se med sine egne øjne.
Herunder er fremgangsmåden trin for trin, hvad der sker bag knappen, og — lige så vigtigt — hvornår du ikke kan stole på resultatet.
Hvad er et usynligt tekstlag?
En almindelig PDF fra Word indeholder rigtige bogstaver. En scanning indeholder kun et billede. OCR — tekstgenkendelse — er det trin, hvor en maskine kigger på billedet og gætter, hvilke bogstaver der står hvor.
Resultatet bliver skrevet ind i PDF'en som tekst, man ikke kan se: hvert ord lægges præcis dér, hvor det står på billedet, men uden farve. Du ser stadig den oprindelige scanning, pixel for pixel. Men når du trykker Ctrl+F eller trækker musen hen over en linje, er det det usynlige lag, du rammer. Det er derfor, man kan markere tekst i en scannet side, der er gjort søgbar — markeringen ligger oven på billedet.
Tekstgenkenderen i UniteDocs hedder Tesseract og er bygget ind i det PDF-bibliotek, programmet bruger. Kun sprogfilerne til dansk og engelsk følger med, omkring 6 MB ifølge ændringsloggen, så du skal ikke installere noget ekstra, og intet sendes nogen steder hen.
Sådan gør du en scannet PDF søgbar trin for trin
Du skal bruge UniteDocs, et gratis PDF-program til Windows 10 og 11. Det har åben kildekode og kræver ingen konto.
Én eller flere scanninger til én søgbar PDF
- Åbn filerne. Tryk på »Tilføj filer« (Ctrl+O), eller træk dem ind i vinduet. Du kan blande PDF-filer og billeder — .jpg, .png, .bmp og .tiff — så et foto af et brev taget med telefonen kan komme med.
- Ret siderne til. Ligger en side på tværs, drejer du den med »Venstre« eller »Højre«. Flyt filerne i den rækkefølge, de skal stå i det samlede dokument.
- Tryk på »Flet og gem« (Ctrl+S). Vinduet »Vælg format« dukker op.
- Vælg »PDF« og tryk »OK«.
- Vælg, hvor filen skal ligge, og giv den et navn. Programmet foreslår »Flettet.pdf«.
- Vent. Undervejs står der »Gør scannede sider søgbare (OCR)...« i fremdriftsvinduet. Til sidst kommer »Fletning fuldført« med en genvej til mappen, hvor filen ligger.
Flere scanninger, hver for sig
Vil du beholde filerne adskilt, så brug »Gem enkeltfiler« (Ctrl+Shift+S) i stedet. Vælg »PDF«, og vælg derefter en mappe. Hver fil gemmes for sig med et tekstlag på de scannede sider.
To ting er værd at vide. »Gem enkeltfiler« tager kun PDF-filer med; løse billeder skal i gennem »Flet og gem«. Og programmet overskriver aldrig originalen: Gemmer du i samme mappe, får den nye fil et _1 på enden af navnet.

Hvad sker der bag knappen?
Programmet går side for side gennem det dokument, det er ved at gemme, og stiller ét spørgsmål: Har siden tekst i forvejen? Har den det, rører det den ikke. En Word-PDF, en lønseddel fra lønsystemet eller en side, der allerede er kørt gennem tekstgenkendelse, bliver hverken læst igen eller ændret. Det er kun sider, der består af billede og ingenting andet, der bliver læst.
Hver af de sider gøres til et billede i 200 dpi, tekstgenkenderen læser det med dansk og engelsk, og ordene lægges ind som usynlig tekst. Selve scanningen bliver ikke ændret. Det tager nogle sekunder pr. side, så et bundt på hundrede sider kræver tålmodighed.
Har du drejet en side med »Venstre« eller »Højre«, læser programmet den, som den ligger i filen, og drejer så tekstlaget med rundt, så billede og tekst følges ad.
Har du maskeret noget, før du gemmer, sker tekstgenkendelsen bagefter. Det, der er dækket, kommer derfor ikke med i tekstlaget. Mere om maskering i artiklen om, hvorfor en sort kasse ikke er nok til at anonymisere en PDF.
Scanningen som tekst: Markdown, ePub og ren tekst
Nogle gange vil man slet ikke have en PDF, men teksten. Den skal måske ind i et notat, i et sagssystem eller læses på en e-bogslæser. I den samme dialog »Vælg format« kan du vælge »Markdown (.md)«, »ePub (.epub)« eller »Ren tekst (.txt)«. Ønsket om Markdown og ePub kom fra Jeppe på LinkedIn, og det er derfor, de står der.
Ved de tre tekstformater bliver de scannede sider også læst med tekstgenkendelse, og teksten står på sin plads mellem de sider, der havde tekst i forvejen. Som dialogen selv siger: »Tekstformater bevarer ikke billeder og layout.«
Det vigtigste er det, der sker, når en side ikke kan læses. Siden forsvinder ikke stille ud af filen. I stedet står der på dens plads:
[Side 4: teksten kunne ikke udtrækkes — siden er sandsynligvis en scanning uden tekstlag og er derfor ikke med her.]
Øverst i filen står hvor mange: »Bemærk: 1 side(r) i dette dokument indeholder ingen tekst der kunne udtrækkes. De er markeret i teksten nedenfor.« Og når programmet er færdigt, melder det »1 side(r) uden tekstlag blev ikke udtrukket«. Sidetallet er sidens nummer i den oprindelige fil, så du kan slå den op. Helt tomme sider markeres ikke — de ville bare være støj. Er der slet ingen tekst at finde i hele dokumentet, får du ingen tom fil, men beskeden »Der blev ikke fundet nogen tekst i dokumentet«.
![En Markdown-fil eksporteret fra UniteDocs åbnet i Notesblok, med bemærkningen om en side uden tekst øverst og markeringen »[Side 4: teksten kunne ikke udtrækkes …]« midt i teksten](/api/blog/images/blog-1790887173377-bm068i.webp)
Hvad du kan, når den scannede PDF er søgbar
- Søge med Ctrl+F i enhver PDF-læser — Edge, Adobe Reader, en browser. Find »advarsel«, en dato eller et navn i et bundt på 80 sider uden at bladre.
- Markere og kopiere en passage ind i et notat eller en mail i stedet for at skrive den af.
- Finde CPR-numre og navne, før dokumentet deles. Søg på »CPR« eller på de første cifre i nummeret. I UniteDocs kan »Søg og masker« og »Anonymiser« også finde dem på scannede sider, fordi de læser siderne med tekstgenkendelse først. Det er den del, jeg selv bruger mest, og den er beskrevet i artiklen om GDPR-fælderne ved PDF-anonymisering.
Har du kun én fil og ingen scanninger, men vil af med forfatternavn og andre skjulte oplysninger, før den sendes videre, så kan browserværktøjet fjerne metadata fra PDF-filen uden at installere noget.
Det kan programmet ikke
Tekstgenkendelse er et gæt. Et godt gæt på en pæn scanning, et dårligt gæt på et skævt fax-ark. Her er grænserne — dem, jeg kender fra koden og fra ændringsloggen.
Kun dansk og engelsk
Sprogfilerne er dansk og engelsk. En tysk kontrakt eller en polsk lønseddel bliver også læst, men med de to sprogs bogstaver og ordforråd. Særlige tegn som ß, ł og ő bliver ofte til noget andet, og så finder Ctrl+F ikke ordet.
Dårlige scanninger giver dårlig tekst
Uskarpe, skæve, mørke eller meget små bogstaver giver forkerte bogstaver i tekstlaget. Det er det klassiske problem: »1« bliver til »l«, »0« til »O«, og et CPR-nummer med ét forkert læst ciffer bliver ikke fundet. Programmet lægger det tekstlag ind, det får — også når det er forkert. Kun hvis der slet ingen ord blev fundet, ved du det. Et nul-resultat betyder derfor ikke, at ordet ikke står der. Søger du efter noget, der skal fjernes, så bladr de vigtige sider igennem selv bagefter.
Håndskrift
Tekstgenkenderen er lavet til trykt tekst. En underskrift, en håndskrevet bemærkning i marginen eller et udfyldt skema med kuglepen bliver ikke læst pålideligt — regn med, at det ikke kommer med.
En side med bare lidt tekst bliver sprunget over
Programmet læser kun sider, der har ingen tekst i forvejen. Har scanneren eller et andet program sat et sidetal, et stempel eller en dato på siden som rigtig tekst, regnes hele siden som en tekstside og bliver ikke læst. Resten af siden forbliver et billede, du ikke kan søge i.
Når en side ikke kan læses, siger PDF'en det ikke
Ved Markdown, ePub og ren tekst får du en markering og et tal. Ved PDF får du ingenting: siden gemmes bare uden tekstlag. Vil du vide, om alle sider kom med, så eksportér samme bundt som »Ren tekst (.txt)« bagefter og se, om der står »[Side …: teksten kunne ikke udtrækkes …]« nogen steder.
Scanninger, der ligger på tværs i selve billedet
Drejer du en side i programmet, følger tekstlaget med. Men er arket kørt skævt eller på tværs gennem scanneren, så bogstaverne ligger ned i selve billedet, er det en anden sag. I min egen prøve med sådan en side blev ordene fundet ved søgning, men markeringen lå ikke oven på teksten i billedet. Søgbar, altså, men ikke pæn.
Du kan ikke afbryde midt i tekstgenkendelsen
Fremdriftsvinduet har en annullér-knap, men den stopper ikke selve tekstgenkendelsen, når der gemmes som PDF. Har du lagt 300 sider i, så start det, når du alligevel skal holde pause.
Ofte stillede spørgsmål
Er det gratis at gøre en scannet PDF søgbar?
Ja. UniteDocs er gratis, kræver ingen konto, og kildekoden er åben (AGPL-3.0).
Bliver mine dokumenter sendt til en server?
Nej. Tekstgenkendelsen kører på din egen pc. Det er netop pointen med de dokumenter, man har i en sag: lønsedler, helbredsoplysninger og CPR-numre skal ikke uploades til et tilfældigt OCR-site.
Kan jeg se, om en PDF allerede er søgbar?
Åbn den i din PDF-læser, og prøv at markere en linje med musen eller søge efter et ord, du kan se. Lykkes det, har siden tekst. Lykkes det ikke, er det en ren scanning. Du behøver ikke sortere selv før du gemmer i UniteDocs: sider med tekst bliver ikke rørt.
Bliver filen meget større?
Tekstlaget er ren tekst og fylder meget lidt i forhold til billederne. Selve scanningen bliver ikke lavet om, så billedkvaliteten er den samme som før.
Virker det på billeder taget med telefonen?
Ja, hvis du lægger dem i via »Flet og gem«. Billedet bliver til en PDF-side og får et tekstlag som enhver anden scanning. Jo skarpere og mere lige billedet er taget, jo bedre bliver teksten.
Næste artikel i serien handler om at flette PDF-filer, der hver har deres eget kodeord — den slags bundter, hvor lønsedlerne kommer låst med hver sin adgangskode.
Læs også
Synes du artiklen var nyttig?
Del den med dit netværk