Projekt

Ogólne

Profil

Przygotowanie skanów » Historia » Wersja 6

« Poprzednie - Wersja 6/8 (diff) - Następne » - Obecna wersja
Monika Sałach, 2026-09-04 13:48


Przygotowanie skanów

Wstęp

Skany załadowane na platformę sa przetwarzane na tekst automatycznie z wykorzystaniem oprogramowania OCR (Optical Character Recognition). Aby zminimalizować błędy rozpoznawania znaków i osiągnąć jak najlepszą jakość wczytanego tekstu skany musza spełniać kilka warunków:
  • Pliki są w formacie JPG lub PNG
  • Każdy plik zawiera jedną stronę książki
  • Obrazki w plikach sa tak przycięte, żeby była widoczna tylko strona książki bez fragmentów innych stron lub tła
  • Nazwy plików zawierają tylko kolejne liczby (nie musza odpowiadać numerom stron) z dodanymi wiodącymi zerami, aby każda nazwa zawierała tyle samo cyfr. Np. dla książki o ponad 100 stronach pliki powinny nosić nazwy 000.jpg, 001.jpg, 002.jpg, ..., 010.jpg, 011.jpg itd.

Dodatkowo, zarówno dla potrzeb OCR, jak i pracujących na tekstach osób redagujących, wskazane jest żeby skany miały jak najlepszą jakość, tzn. aby miały odpowiednią rozdzielczość, jak największy kontrast, jasne tło i mało zanieczyszczeń.

Skany z Wolnych Lektur

Obrazy zapisane przez nasz firmowy skaner najczęściej mają wygląd podobny do takiego:

podczas gdy do dalszego przetwarzania powinny wyglądać tak:

Bezpłatnym narzędziem do obróbki zdjęć pozwalającym w miare prosty sposób przyciąć, obrócić i poprawić jakość skanów jest aplikacji Darktable, Instrukcja obróbki skanoów w Darktable

Skany z innych źródeł

Skany pochodzące z innych źródeł moga być w postaci dokumentów (DOC, PDF) lub plików DJVU - pojedynczego pliku zawierającego skany wszystkich stron książki. Aby wygenerować pojedyncze pliki ze skanami użyj jednej z poniższych instrukcji:

Ujednolicenie nazw plików

Dla poprawnego działania mechanizmu OCR, tzn. przetwarzania stron w odpowiedniej kolejności, jak i dla zachowania standardów nazewnictwa, zmień odpowiednio nazwy plików używając instrukcji Zmiany nazw plików.