
Друкований текст із фото сьогодні копіюється прямо в телефоні, а для українського рукопису в серпні 2026 року з'явився окремий сервіс Rukopys OCR. Розбираємось, що підходить для чого, і показуємо короткий код для тих, хто воліє працювати зі скриптами.
Технологія називається OCR, тобто оптичне розпізнавання символів (від англ. optical character recognition): програма знаходить на зображенні літери й повертає їх як звичайний текст. Для чистого друку це давно вирішена задача. Складнощі починаються з почерку, адже класичні бібліотеки створювали саме для друкованих шрифтів.
Друкований текст зі смартфона
На iPhone XS, XR і новіших моделях з iOS 15 або пізнішою системою працює функція Live Text. Відкрийте фото в застосунку «Фото», затримайте палець на тексті, змініть межі виділення й скопіюйте. Ту саму дію можна виконати просто в кадрі камери, не роблячи знімка.
На Android і в iPhone працює Google Lens: відкрийте його в застосунку Google, виберіть знімок із галереї, позначте текст і скопіюйте. Якщо ви увійшли в той самий акаунт Google, текст можна одразу надіслати на комп'ютер.
Перш ніж довіряти результату, перевірте короткий фрагмент: чи правильно прочитані літери «і», «ї», «є», «ґ» та апострофи. Підтримку мов краще уточнити в довідці виробника, бо вона змінюється з оновленнями.
Що впливає на точність
Умови зйомки дають більше, ніж вибір програми. Розпізнавання працює найкраще за таких умов:
- фото зроблено прямо, без перекосу;
- контраст між літерами й тлом чіткий;
- тло однотонне, без візерунків і тіней;
- літери різкі, а не розмиті.
Якщо є вибір, краще взяти скан, а не фото: так менше перекосів і тіней, а отже менше помилок у рядках.
Онлайн-сервіси та Tesseract
Безкоштовні онлайн-розпізнавачі працюють за простою схемою: завантажуєте файл, обираєте мову тексту, копіюєте результат або експортуєте у Word чи TXT. Частина сервісів на основі Tesseract.js, за заявами власників, обробляє зображення в браузері й не надсилає файл на сервер. Паспорти, договори та інші документи з персональними даними все одно краще не завантажувати на випадкові сайти.
Тим, хто пише код, підійде сам Tesseract. Це безкоштовний рушій з відкритим кодом під ліцензією Apache 2.0, який використовує нейромережу архітектури LSTM (довга короткочасна пам'ять) і має готові дані для української мови у файлі ukr.traineddata. Встановіть Tesseract, мовний пакет ukr і бібліотеки Pillow та pytesseract, а далі достатньо чотирьох рядків:
from PIL import Image
import pytesseract
img = Image.open("foto.jpg")
print(pytesseract.image_to_string(img, lang="ukr"))
Для друку з чітким контрастом цього вистачає. З рукописом результат буде слабким: у офіційних відповідях на поширені запитання Tesseract сказано, що рушій розрахований на друкований текст, і для почерку радять шукати спеціалізовані проєкти. Спробуйте нашу онлайн версію яка дозволяє розпізнати текст на фото для копіювання.
Український рукопис: Rukopys OCR
Для почерку потрібна модель, навчена саме на рукописних прикладах. У травні 2026 року Мінекономіки представило RUKOPYS, перший відкритий розмічений набір даних українського рукописного тексту, створений у межах хакатону Handwritten to Data. Це матеріал для навчання моделей, а не готовий застосунок.
Готовий сервіс з'явився наприкінці серпня 2026 року: платформа Lapathoniia запустила Rukopys OCR на інфраструктурі українського хмарного провайдера De Novo. В основі лежить модель Rukopys-OCR-4B, яку донавчили на базі Qwen3.5 розміром 4 мільярди параметрів і опублікували під ліцензією Apache 2.0.
Друк і рукопис — різні задачі: для першого достатньо готової бібліотеки, для другого потрібна модель, яку навчили на почерках.
Сторінку система читає за один прохід: визначає текстові блоки, їхній тип і координати, а потім розпізнає текст. У вебінтерфейс завантажують JPEG, PNG, WebP, TIFF і PDF, зокрема багатосторінкові. Результат можна поправити вручну й зберегти як TXT, структурований JSON або PDF із текстовим шаром, у якому працює пошук. Є й API, сумісний із форматом OpenAI.
Що відомо про точність
Розробники заявляють, що в їхніх внутрішніх тестах модель робить на 59–64% менше помилок, ніж Gemini-3 Flash. Тестували на закритій частині набору даних, і самі автори застерігають, що на інших документах показники можуть відрізнятися. Незалежних порівнянь на 5 жовтня 2026 року ми не знайшли, тож перевіряйте сервіс на власних сторінках.
Приватним користувачам сервіс доступний для безкоштовного тестування. Для великих обсягів розробники називають орієнтовну ціну близько 0,03 долара за сторінку в звичайному режимі й 0,018 долара в пакетному. Модель опублікована на Hugging Face, тож її можна розгорнути на власній інфраструктурі, що важливо для чутливих документів.
Що таке датасет RUKOPYS
RUKOPYS — відкритий розмічений набір зображень українського рукописного тексту, де до фрагментів додано правильну розшифровку, за якою моделі вчаться читати почерк. Після завершення змагання набір опублікували на Hugging Face під ліцензією CC BY 4.0, яка дозволяє комерційне використання із зазначенням авторства.
Який спосіб обрати
Вибір залежить від того, що саме на фото і чи є там персональні дані. Порівняння зручно звести в таблицю:
| Спосіб | Найкраще підходить | Обмеження |
|---|---|---|
| Live Text і Lens | Друк, скріншоти й швидке копіювання. | Рукопис і українські літери треба перевіряти. |
| Онлайн-сервіс | Разові скани сторінок без встановлення програм. | Не для документів із персональними даними. |
| Tesseract і Python | Пакетна обробка друкованих сторінок. | Слабко читає почерк і складну верстку. |
| Rukopys OCR | Українські зошити, конспекти, архівні папери. | Сервіс новий, незалежних порівнянь поки мало. |
Для сторінки з конспектом від руки порядок такий:
- Покладіть аркуш на рівну поверхню й сфотографуйте зверху за денного світла.
- Завантажте знімок у Rukopys OCR і дочекайтеся результату.
- Порівняйте текст зі сторінкою, особливо імена, дати та цифри.
- Збережіть виправлену версію у TXT або PDF із текстовим шаром.
Складні таблиці та нестандартну верстку прості розпізнавачі читають гірше за суцільний текст, а формули зручніше набрати наново в редакторі LaTeX на нашому сайті, щоб вони потрапили в розмітку MathJax без помилок.
Для друку вистачає камери телефона, для пакетної роботи підійде Tesseract, а для українського рукопису варто спробувати спеціалізовану модель, адже за даними її розробників універсальні інструменти на почерку помиляються частіше. Результат будь-якого розпізнавання потребує вичитки, особливо коли йдеться про імена, дати й суми. Напишіть у коментарях, на якому почерку і яким способом вам вдалося отримати чистий текст.
Схожі публікації