Przygotowanie skanów » Historia » Wersja 4
Wersja 3 (Monika Sałach, 2026-09-04 13:04) → Wersja 4/8 (Monika Sałach, 2026-09-04 13:10)
h1. Przygotowanie skanów
h2. Wstęp
Skany załadowane na platformę sa przetwarzane na tekst automatycznie z wykorzystaniem oprogramowania OCR (Optical Character Recognition). Aby zminimalizować błędy rozpoznawania znaków i osiągnąć jak najlepszą jakość wczytanego tekstu skany musza spełniać kilka warunków:
* Pliki są w formacie JPG lub PNG
* Każdy plik zawiera jedną stronę książki
* Obrazki w plikach sa tak przycięte, żeby była widoczna tylko strona książki bez fragmentów innych stron lub tła
* Nazwy plików zawierają tylko kolejne liczby (nie musza odpowiadać numerom stron) z dodanymi wiodącymi zerami, aby każda nazwa zawierała tyle samo cyfr. Np. dla książki o ponad 100 stronach pliki powinny nosić nazwy 000.jpg, 001.jpg, 002.jpg, ..., 010.jpg, 011.jpg itd.
Dodatkowo, zarówno dla potrzeb OCR, jak i pracujących na tekstach osób redagujących, wskazane jest żeby skany miały jak najlepszą jakość, tzn. aby miały odpowiednią rozdzielczość, jak największy kontrast, jasne tło i mało zanieczyszczeń.
h2. Skany z Wolnych Lektur
Obrazy zapisane przez nasz firmowy skaner najczęściej mają wygląd podobny do takiego:
!011_org.jpg!
podczas gdy do dalszego przetwarzania powinny wyglądać tak:
!011.jpg!
Bezpłatnym narzędziem do obróbki zdjęć pozwalającym w miare prosty sposób przyciąć, obrócić i poprawić jakość skanów jest aplikacji Darktable; poniższa instrukcja pokazuje jak to zrobić.
[[Obróbka skanów w Darktable v2.docx]]
h2. Wstęp
Skany załadowane na platformę sa przetwarzane na tekst automatycznie z wykorzystaniem oprogramowania OCR (Optical Character Recognition). Aby zminimalizować błędy rozpoznawania znaków i osiągnąć jak najlepszą jakość wczytanego tekstu skany musza spełniać kilka warunków:
* Pliki są w formacie JPG lub PNG
* Każdy plik zawiera jedną stronę książki
* Obrazki w plikach sa tak przycięte, żeby była widoczna tylko strona książki bez fragmentów innych stron lub tła
* Nazwy plików zawierają tylko kolejne liczby (nie musza odpowiadać numerom stron) z dodanymi wiodącymi zerami, aby każda nazwa zawierała tyle samo cyfr. Np. dla książki o ponad 100 stronach pliki powinny nosić nazwy 000.jpg, 001.jpg, 002.jpg, ..., 010.jpg, 011.jpg itd.
Dodatkowo, zarówno dla potrzeb OCR, jak i pracujących na tekstach osób redagujących, wskazane jest żeby skany miały jak najlepszą jakość, tzn. aby miały odpowiednią rozdzielczość, jak największy kontrast, jasne tło i mało zanieczyszczeń.
h2. Skany z Wolnych Lektur
Obrazy zapisane przez nasz firmowy skaner najczęściej mają wygląd podobny do takiego:
!011_org.jpg!
podczas gdy do dalszego przetwarzania powinny wyglądać tak:
!011.jpg!
Bezpłatnym narzędziem do obróbki zdjęć pozwalającym w miare prosty sposób przyciąć, obrócić i poprawić jakość skanów jest aplikacji Darktable; poniższa instrukcja pokazuje jak to zrobić.
[[Obróbka skanów w Darktable v2.docx]]