програми
FineParser працює на одному контейнері ЦП і зберігає таблиці та макет перед подачею документів до LLM
Компанія ABBYY розробила свій движок FineReader OCR як окремий інструмент для перетворення документів у структурований текст, який можуть використовувати системи ШІ.
Новий FineParser компанії працює в контейнері Docker на центральному процесорі, не потребуючи графічного процесора. Його мета — зберегти макет документа під час вилучення його вмісту.
Він бере зображення документів на різних мовах і перетворює їх у структурований і відформатований текст, щоб їх можна було обробляти за допомогою, наприклад, сучасних LLM, що генерують ШІ. Це не єдина його мета: компанія припустила, що це може допомогти імпортувати друкований текст у сучасну CMS або для архівування, або як етап у певній формі виробництва.
ABBYY описує підхід FineParser як «детермінований» ШІ. Він витягує текст і структуру документа замість того, щоб створювати їх прийнятний переклад. Потім результат можна передати системі генерації штучного інтелекту, відповіді якої менш передбачувані.
Компанія також пропонує власну програмовану структуру машинного навчання NeoML, яка є FOSS і доступна на GitHub. Він також публікує OCR SDK для компаній, які хочуть інтегрувати механізм FineReader у свої продукти.
Сам FineParser не є відкритим кодом, хоча ABBYY підтримує репозиторій GitHub для прикладів і підтримки спільноти. Автономний інструмент має безкоштовний рівень, який дозволяє 1000 сторінок на місяць протягом року. ABBYY каже, що її рівні підписки підключаються до сервера ліцензій для автентифікації; Для повного розгортання в автономному режимі потрібен план Enterprise.
Збереження структури означає розпізнавання стовпців у порядку читання, заголовків і таблиць, навіть без рамок, замість повернення вилученого тексту. ABBYY каже, що FineParser також працює з рукописним текстом і більш ніж 200 мовами.
Розробники можуть надсилати документи через REST API FineParser і отримувати результати у вигляді звичайного тексту, JSON або DocLang, компактного формату, розробленого для введення LLM.
Проблема з FineParser полягає в тому, що щось має правильно прочитати документ, перш ніж LLM зможе його використовувати. Компанія ABBYY вважає, що її підхід до оптичного розпізнавання символів (OCR), розроблений десятиліттями, — робота на центральному процесорі, збереження макета та надання генерації тексту іншим інструментам — все ще знаходиться на стадії розробки AI. Іноді стара частина є корисною. ®