Computer vision · Obraz i tekst

Multimodalna AI w firmie: obrazy, dokumenty i tekst w jednym systemie

Wiele procesów w firmie nie ogranicza się do tekstu: zdjęcia szkód, zeskanowane dowody dostawy, odczyty liczników, etykiety, formularze. Modele multimodalne rozumieją jednocześnie obraz i tekst, więc mogą przejąć takie zadania bez dużych zbiorów danych treningowych. Oto przegląd tego, gdzie to już dziś działa, a gdzie jeszcze nie.

Aleksandra Osztynowicz 5 min czytania
Kolorowa ilustracja wielokątnego mózgu połączonego z symbolami wykresów, danych i sygnałów

Najważniejsze w skrócie

  • Modele multimodalne przetwarzają w jednym modelu tekst, obrazy, a często także dźwięk, i odpowiadają na pytania o to, co widzą.
  • Typowe zastosowania to przetwarzanie dokumentów, sprawdzanie zdjęć, odczytywanie wyświetlaczy oraz kontrola opakowań i montażu.
  • Największa zaleta: wymagania można opisać słowami, a prototyp powstaje bez tysięcy oznaczonych przykładów.
  • Przed wdrożeniem produkcyjnym trzeba przetestować model na własnych danych. W kontroli jakości w przemyśle wyspecjalizowane metody są często nadal dokładniejsze.

Czym są modele multimodalne

Klasyczne sieci neuronowe specjalizują się w jednym rodzaju danych, np. w obrazach albo w tekście. Modele multimodalne łączą kilka rodzajów danych w jednym systemie: patrzą na zdjęcie, czytają dołączone polecenie i odpowiadają tekstem. Dzięki temu da się wykonać zadania, które wcześniej wymagały kilku osobnych modeli, np. opisać obraz, odpowiedzieć na pytania o niego albo zrozumieć tekst w dokumencie w jego kontekście.

Dla firm nowe jest przede wszystkim to, że wymagania można po prostu opisać. Zamiast oznaczać tysiące przykładów „poprawnie zmontowanego” produktu, wyjaśniasz modelowi, na co ma zwracać uwagę.

Zastosowania i nakład pracy

ZastosowanieCo przejmuje modelNakład pracy
Dokumentyodczytywanie faktur, dowodów dostawy, formularzy i załączników oraz przekazywanie danych w uporządkowanej formieśredni: różnorodność formatów, porównanie z danymi podstawowymi
Kontrola uszkodzeńsprawdzanie zdjęć paczek, pojazdów lub towarów pod kątem widocznych uszkodzeń i ich dokumentowanieniski do średniego: jasne kryteria, przykładowe zdjęcia
Odczyt wyświetlaczyodczytywanie stanów liczników, wyświetlaczy lub etykiet ze zdjęćśredni: odsetek błędów trzeba zmierzyć na prawdziwych zdjęciach
Opakowania i montażsprawdzanie, czy wszystkie części są na miejscu i prawidłowo ułożone, oraz podpowiadanie kolejnych krokówśredni: instrukcje krok po kroku, testy dla każdego wariantu
Kontrola jakości w przemyślewykrywanie drobnych wad na powierzchniach lub elementachwysoki: często tylko w połączeniu z modelami wyspecjalizowanymi

W praktyce: Radaway

U producenta wyposażenia łazienek zamówienia przychodzą e-mailem, często z zamówieniem w załączniku. Po naszych usprawnieniach system obsługuje także zamówienia w załącznikach: pokrycie tego typu zamówień wzrosło z 0 do 100%, a liczba ręcznych interwencji spadła łącznie o 90%.

Zobacz projekt Radaway

Przykład: odczyt stanu licznika ze zdjęć

W teście z 2024 roku kamera kilka razy dziennie fotografowała wodomierz. Czerwony prostokąt oznaczał liczydło, a model miał zwrócić wartość w ustalonym formacie, tak aby można ją było od razu przetwarzać dalej.

Test modelu multimodalnego: prompt do odczytu wodomierza, dwa zdjęcia licznika z liczydłem zaznaczonym na czerwono i odczytane wartości
Test z 2024 roku z GPT-4 Vision: polecenie, zdjęcie i odczytana wartość.

Przykład pokazuje, co jest ważne: jasne polecenie, ustalony format odpowiedzi i przygotowany obraz, w tym przypadku z zaznaczonym obszarem.

Jak napisać dobre polecenie

  • Jasno i krok po kroku: opisz dokładnie, co model ma zrobić z obrazem, we właściwej kolejności.
  • Podaj kontekst: czego dotyczy zadanie, jakie warianty się zdarzają, jakie błędy są typowe.
  • Ustalony format: określ strukturę odpowiedzi, jeśli wynik ma być dalej przetwarzany.
  • Pokaż przykłady: przy subtelnych różnicach dołącz jedno lub kilka przykładowych zdjęć.
  • Dopuść niepewność: pozwól modelowi odpowiedzieć „nieczytelne”, zamiast zgadywać.

Gdzie są granice

Nasze testy z 2024 roku pokazały trzy typowe słabości. Modele od tego czasu się poprawiły, ale te punkty nadal warto sprawdzać w każdym projekcie:

  • Liczenie: wiarygodne policzenie wielu podobnych obiektów często udawało się tylko przy bardzo szczegółowych poleceniach.
  • Dokładne położenie: modele chętniej piszą „na dole po lewej”, niż podają dokładne współrzędne. Do precyzyjnej lokalizacji potrzebne jest klasyczne computer vision.
  • Rozpoznawanie tekstu: pojedyncze znaki bywały dodawane lub pomijane. Tam, gdzie liczy się każda cyfra, potrzebne są kontrole wiarygodności.

W wykrywaniu wad w przemyśle wyspecjalizowane metody są często nadal dokładniejsze. Nasz test w tym obszarze kończy się wnioskiem, że modele multimodalne na razie je uzupełniają i jeszcze ich nie zastępują. Więcej w artykule LLM w kontroli wizualnej i kontroli jakości.

Jak się do tego zabrać

  1. Określ zadanie i kryteria: co ma zostać rozpoznane na obrazie lub w dokumencie i co uznajemy za poprawny wynik?
  2. Prototyp z modelem multimodalnym: w ciągu kilku dni sprawdź, czy zadanie w ogóle da się rozwiązać.
  3. Pomiar na prawdziwych danych: ustal odsetek błędów na reprezentatywnej próbce własnych zdjęć lub dokumentów.
  4. Decyzja: model multimodalny, model wyspecjalizowany albo ich połączenie.
  5. Integracja i monitorowanie: przekazuj wyniki do istniejących systemów i stale sprawdzaj je na produkcji.

Jak systematycznie porównywać modele, opisujemy w artykule LLMOps w firmie: benchmarki i porównanie modeli vision LLM.

Automatyczna ocena zdjęć i dokumentów?

Na Twoich danych sprawdzamy, czy model multimodalny niezawodnie rozwiązuje Twoje zadanie, i planujemy drogę do wdrożenia produkcyjnego.

Zapytaj o analizę procesu

Najczęściej zadawane pytania

To modele AI, które przetwarzają jednocześnie kilka rodzajów danych, takich jak tekst, obrazy, a często także dźwięk. Mogą np. ocenić zdjęcie na podstawie dołączonego polecenia i odpowiedzieć tekstem.

Na przykład do przetwarzania faktur, dowodów dostawy i załączników, sprawdzania zdjęć pod kątem uszkodzeń, odczytywania liczników i wyświetlaczy oraz kontroli opakowań i montażu.

Na początek zwykle nie. Wymagania można opisać słowami i kilkoma przykładowymi zdjęciami. Przed wdrożeniem produkcyjnym jakość trzeba zmierzyć na reprezentatywnej próbce własnych danych.

W theBlue.ai analiza ma stałą cenę od 3000 €. Wdrożenie kosztuje zwykle od 25 000 do 100 000 €, a na koniec analizy otrzymujesz wycenę dla określonego zakresu.

Aleksandra Osztynowicz

O autorce

Aleksandra Osztynowicz

AI Engineer, theBlue.ai

Aleksandra od 2021 roku tworzy w theBlue.ai dedykowane rozwiązania AI. Specjalizuje się w systemach agentowych i wdrożeniach lokalnych modeli LLM dopasowanych do potrzeb firm. Jako AI Engineer pomaga organizacjom automatyzować procesy za pomocą systemów gotowych do pracy produkcyjnej: od modeli open source działających on-premise po wewnętrzne bazy wiedzy oparte na RAG dla branż regulowanych. Na bieżąco poszerza swoją wiedzę w szybko zmieniającym się świecie sztucznej inteligencji.

W swoich artykułach dzieli się doświadczeniem z prawdziwych projektów enterprise AI i pokazuje, że wdrożenie AI w firmie nie musi być skomplikowane.