Przejdź do treści głównej

§ 21 · AI & jakość

Dlaczego skany są teraz odczytywane przez dedykowany model OCR — i co to oznacza dla pisma odręcznego

W przypadku zeskanowanych dokumentów i zdjęć stopniowo wdrażamy dedykowany model OCR — zamiast, jak dotychczas, wykorzystywać do przepisywania tekstu ogólny model czatu AI. To daje realną przewagę techniczną oraz, według dostawcy, zauważalnie lepsze rozpoznawanie pisma odręcznego. Mówiąc szczerze: „zauważalnie lepsze” to nie to samo, co „rozwiązane”.

4 minAI & jakość
Symboliczny obraz dedykowanego modelu OCR: pojedyncza ciepła wiązka światła precyzyjnie przesuwająca się po delikatnie świecącym stosie zeskanowanych stron, ukazując pod nią subtelną strukturę, na ciemnozielono-oxbloodowym tle

Czym dotychczas było u nas rozpoznawanie tekstu

Za każdym razem, gdy przesyłają Państwo skan lub zdjęcie dokumentu — zeskanowaną umowę, sfotografowane pismo kancelarii, odręczną notatkę na formularzu — platforma musi najpierw zamienić treść obrazu na prawdziwy, przeszukiwalny tekst, zanim w ogóle będzie mogła rozpocząć się jakakolwiek analiza AI. Dotychczas robił to ogólny model czatu AI z prostym poleceniem: „przepisz ten obraz wiernie". W praktyce działa to zaskakująco dobrze — ale technicznie nie jest to to samo, co produkt faktycznie wytrenowany do rozpoznawania tekstu.

Różnica: dedykowane narzędzie zamiast objazdu

Stopniowo udostępniamy teraz bezpośredni dostęp do dedykowanego modelu OCR — produktu, którego jedynym zadaniem jest rozpoznawanie tekstu, a nie prowadzenie rozmowy. Brzmi to jak drobny niuans techniczny, ale ma dwie konkretne konsekwencje.

Po pierwsze: żadnego ryzyka tłumaczenia, i to strukturalnie. Model czatu interpretuje polecenie w rodzaju „przepisz to" w kontekście rozmowy — model językowy, który widzi dokument w obcym języku, mógłby w rzadkich przypadkach błędnie zrozumieć polecenie jako prośbę o tłumaczenie zamiast przepisania. Dedykowany model OCR w ogóle nie zna takiego pojęcia jak polecenie tego rodzaju — nie ma „rozmowy", którą mógłby błędnie zinterpretować, jest tylko tekst wydobywany z obrazu.

Po drugie: niezawodność, którą sami sprawdziliśmy przed wdrożeniem. Przed aktywacją przepuściliśmy nową ścieżkę przez dokument testowy pełen francuskich i niemieckich znaków specjalnych (é, à, ç, ê, œ oraz ä, ö, ü, ß). Każdy pojedynczy znak wrócił dokładnie poprawny — bez błędów kodowania, bez cichych podstawień.

Pismo odręczne: lepiej, ale nie „rozwiązane"

Tu robi się szczerze interesująco, ponieważ częsty u nas przypadek użycia to właśnie ten: odręczna notatka na poza tym drukowanym formularzu, odręczny testament, odręczne uzupełnienie umowy. Sam dostawca modelu określa ten nowy model jako swój najlepszy jak dotąd wynik w rozpoznawaniu pisma odręcznego. Nie chcemy Państwu tego zataić — ale też nie chcemy tego przechwalać.

Niezależne testy porównawcze branży pokazują spójny obraz: rozpoznawanie pisma odręcznego jest wyraźnie trudniejsze niż tekstu drukowanego praktycznie u każdego dostawcy, a na rynku istnieją wyspecjalizowane oferty, które w samym rozpoznawaniu pisma odręcznego osiągają jeszcze lepsze wyniki niż ogólny produkt OCR. Co to oznacza dla Państwa w praktyce: odręczna notatka jest teraz rozpoznawana bardziej niezawodnie niż wcześniej — ale dokument, w którym odręczny fragment ma decydujące znaczenie prawne (odręczna linia pod testamentem, odręczne uzupełnienie umowy), nadal należy zweryfikować na oryginale, zanim polegną Państwo wyłącznie na przepisie AI.

Gdzie to działa

Nowa ścieżka działa wszędzie tam, gdzie dotychczas już działało rozpoznawanie tekstu: przy przesyłaniu plików w portalu klienta, przy zeskanowanych aktach w portalu adwokackim oraz przy dokumentach, które przesyłają Państwo bezpośrednio jako użytkownik prywatny — również w anonimowej szybkiej weryfikacji na stronie głównej. Dotyczy to wyłącznie obrazów i skanów bez własnej warstwy tekstowej; zwykły, cyfrowo utworzony plik PDF jest i tak odczytywany bezpośrednio, bez żadnego rozpoznawania tekstu.

Kto za to płaci

W przypadku kancelarii koszt OCR wlicza się do tego samego kontyngentu AI, który obowiązuje przy każdej innej analizie — jako zwykłe obciążenie, bez odrębnego rozliczenia. Dla użytkowników prywatnych i biznesowych nic się nie zmienia: rozpoznawanie tekstu jest częścią odpowiedniej akcji analitycznej i jej już wyświetlanej stałej ceny, a nie dodatkową pozycją kosztową.

Stopniowo, a nie od razu

Celowo nie udostępniamy tej ścieżki wszystkim jednocześnie, lecz najpierw obserwujemy ją w rzeczywistym działaniu. A ponieważ w tym procesie treść dokumentów jest dodatkowo przekazywana do kolejnego zewnętrznego dostawcy, dostawca ten figuruje w naszym wykazie podprocesorów — przejrzystość co do tego, kto widzi Państwa dane i dlaczego, nie jest dla nas opcjonalna.

Z tej samej pracy: graf relacji teraz także dla Państwa jako użytkownika prywatnego

W tym samym etapie prac wdrożyliśmy drugie, niezależne usprawnienie: graf relacji — pokazujący, jak rozpoznane przez AI informacje w aktach sprawy odnoszą się do siebie nawzajem, wraz z wykrytymi sprzecznościami między dwoma dokumentami — nie jest już ograniczony do portalu adwokackiego. Jest teraz dostępny również dla Państwa jako użytkownika prywatnego. Proszę otworzyć akta sprawy, a od teraz znajdą tam Państwo ten sam widok powiązań, do wyboru jako przeszukiwalną listę lub wizualną sieć.

Biblioteka prawna i pomoc: /wiki · Dla adwokatów: /fuer-anwaelte

Lexi, digitale Rechts-Assistenz

Gotowy, aby wyjaśnić swoją sprawę?

{n} kredytów gratis. Brak konieczności podawania karty kredytowej. Gotowość do startu w 2 minuty.

Zacznij teraz za darmo

Bez karty kredytowej · Zgodność z RODO · Zacznij bezpłatnie

Zacznij za darmo
Brak karty kredytowej
Zacznij