AI-распознавание PDF
AI-распознавание PDF
AI-распознавание PDF – это функция платформы Tangl, которая извлекает данные из PDF-документации с помощью нейросети. Нейросеть считывает каждую страницу документа: чертежи, спецификации, штампы, таблицы – и превращает найденное в элементы со свойствами.
PDF-файл загружается в платформу как модель. Сразу после загрузки модель пустая, а после распознавания в ней появляются элементы. Дальше с моделью можно работать как с любой другой: открывать, смотреть свойства элементов, использовать в анализе.
Как это устроено
- Пользователь загружает PDF-файл.
- Запускает распознавание.
- Сервис распознавания обрабатывает документ постранично. Прогресс виден прямо в интерфейсе.
- Когда распознавание закончится, извлечённые данные автоматически попадут в ту же модель. Новая модель не создаётся.
Распознавание выполняется через модель LLM (нейросеть) Компании пользователя: это может быть как собственная модель, развернутая на локальных серверах, так и сторонняя внешняя модель, подключенная по API.
Независимо от варианта модели, одно условие неизменно – модель должна обладать OpenAI-совместимым API.
Без подключенной модели распознавание не запустится.
Кому доступна функция
AI-распознавание PDF подключается для Компании отдельно. Чтобы включить его, необходимо обратиться в поддержку Tangl.
| Доступное действие | Администратор | Менеджер | Остальные сотрудники |
|---|---|---|---|
| Настройка модели LLM компании | ✅ | ❌ | ❌ |
| Загрузка PDF (как модели) | ✅ | ✅ | ❌ |
| Запуск, остановка или удаление распознавания | ✅ | ✅ | ❌ |
| Просмотр мониторинга распознавания | ✅ | ✅ | ❌ |
| Отображение пунктов меню модуля | ✅ | ✅ | ❌ |
Требования к модели
Предварительно необходимо убедиться, что модель соответствует требованиям:
- API совместимо с OpenAI – запросы идут на
{Адрес API}/chat/completions; - Модель принимает изображения на вход, поскольку страницы документа передаются ей именно изображениями;
- Модель умеет отвечать в формате JSON;.
- Адрес API доступен из интернета по
httpsи указан доменным именем. Адреса во внутренних сетях и IP-адреса недопустимы.
Запросы к модели оплачиваются по тарифам провайдера модели. На распознавание одного документа уходит как минимум по одному запросу на страницу.
Настройка модели LLM
Модель настраивается один раз для всей Компании.
Настройка модели производится на странице Модель AI PDF в Личном кабинете Tangl Auth.
В личном кабинете Tangl Auth нажать кнопку шестерёнки и в меню открыть группу Компания и выбрать пункт Модель AI PDF.

На открывшейся странице заполнить поля:
- Адрес API – ввести адрес пути к интерфейсу, совместимому со стандартом OpenAI. Чаще всего он завершается на
/v1(пример:https://api.example.com/v1) и должен использовать исключительно защищенный протоколhttps; - Модель – указать внутреннее имя или идентификатор нейросети в системе провайдера, (например
qwen/qwen3.8-27b); - API-ключ – секретный ключ, необходимый для авторизации и использования API.
API-ключ – секретные данные. После сохранения ключ нигде не показывается целиком, даже администратору: в форме видны только последние четыре символа (
••••a1b2). Ключ хранится в зашифрованном виде и расшифровывается только в момент обращения к модели.
- Адрес API – ввести адрес пути к интерфейсу, совместимому со стандартом OpenAI. Чаще всего он завершается на
Далее, чтобы убедиться, что всё введено верно, необходимо нажать Проверить подключение. Платформа отправит модели пробный запрос и покажет результат: например, «Подключение работает, ответ за 412 мс» или описание ошибки.
При успешной проверке подключения нажать Сохранить. При сохранении подключение проверяется ещё раз.
Над формой отображается статус настройки и время последней проверки:
- Работает – последняя проверка прошла успешно;
- Не проверено – настройки сохранены, но ещё не проверялись;
- Ошибка – проверка не прошла. Распознавание не запустится, пока настройки не исправлены.

Проверять подключение можно не чаще 5 раз в минуту: каждая проверка – платный запрос к провайдеру модели.
Чтобы сменить адрес или модель, необходимо внести изменения в поля и нажать Сохранить. Поле API-ключ можно оставить пустым – сохранится прежний ключ.
Если во время распознавания модель отклонит ключ, статус настройки сменится на Ошибка, и новые запуски будут отклоняться, пока администратор компании не исправит ключ.
Чтобы заменить ключ, необходимо ввести новый в поле API-ключ и сохранить.
Кнопка Удалить настройки удаляет модель компании. После этого распознавание PDF в компании станет недоступно.
Загрузка PDF
Открыть Входящие либо папку проекта в веб-сервисе Tangl Value или Tangl Control.
Нажать кнопку Загрузить модели и выберите пункт Загрузить .pdf .

Откроется окно загрузки. Перетащить PDF-файл в окно загрузки или нажать на область загрузки и выбрать файл.

Указать Название модели.
Если модель загружается со страницы Входящие, будет предложено выбрать папку проекта, в которой она будет размещена.

- Нажать Загрузить .pdf как модель.
Файл появится в списке моделей. Элементов у него пока нет – они появятся после распознавания.
Запуск распознавания
В списке моделей найти загруженную PDF-модель.
Открыть меню действий в строке модели и выбрать пункт Распознать PDF-модель. Распознать можно любую версию модели: для этого пункт Распознать PDF-модель в строке нужной версии следует выбрать в нужной версии.

В открывшемся окне нажать Запустить обработку. Если у Компании не настроена нейросеть или проверка нейросети не прошла, кнопка запуска будет недоступна, а в окне появится предупреждение. Для Администратора компании будет отображена ссылка Настроить модель.
После запуска откроется окно с индикацией процесса распознавания.
Процесс распознавания
Данные в окне процесса распознавания обновляются автоматически. Однако окно можно закрыть, при желании, нажав на кнопку "х" в правом углу – обработка продолжится. Чтобы вернуться к ней, следует снова нажать Распознать PDF-модель в строке этой модели.
Во время работы отображаются:
статус «Обработка»;
шкала прогресса и количество обработанных страниц (например, «10 из 24»

Если документ еще не в работе, вместо счетчика отображаются статусы ожидания:
- «В очереди — ждёт, пока освободятся слоты компании»: означает, что лимит одновременных задач исчерпан. Обработка начнется автоматически после завершения текущих процессов;
- «Задача ждёт очереди сервиса распознавания...»: файл успешно передан и ожидает начала обработки на стороне сервиса.
Время распознавания зависит от числа страниц и скорости модели нейросети. Большой документ может обрабатываться десятки минут.
Когда распознавание закончится, статус сменится на Завершено, и в окне появится:
- сообщение «Импортировано элементов в модель: N» – столько элементов добавлено в модель;
- блок Извлеченные данные – результат распознавания в формате JSON. Его можно скопировать кнопкой Копировать JSON или сохранить в виде файла кнопкой Скачать JSON.

После этого модель можно открыть пунктом Открыть модель или данные и работать с её элементами и свойствами (см. Окно Модель).
Если распознавание прошло, а перенести данные в модель не удалось, в окне будет кнопка Повторить импорт в модель. Она переносит уже полученный результат ещё раз, документ заново не распознаётся.
Если в блоке Извлеченные данные написано «Нет данных экстракции», скорее всего, в файле нет распознаваемой документации – например, это скан плохого качества или пустые листы.
В окне процесса доступны следующие действия:
- Снять распознавание — прерывает текущую операцию без сохранения результатов. В системе останется запись со статусом "Распознавание снято", что позволит запустить процесс заново в любой момент;
- Удалить распознавание — также останавливает задачу, но при этом навсегда стирает историю её запуска. Сама PDF-модель при этом не удаляется.

Обе операции требуют подтверждения.
Завершённое распознавание удалить нельзя, поскольку вместе с ним будет удален и результат.
Ошибки при работе
Ошибка распознавания
Если распознавание не удалось, статус сменится на Ошибка, а в окне появится описание причины. Чтобы попробовать ещё раз, необходимо нажать Повторить.
Ошибки, связанные с моделью LLM компании:
| Сообщение | Что делать |
|---|---|
| Адрес модели недоступен (неверный URL, сервер выключен или доступ закрыт по IP) | Проверить Адрес API и что сервер модели работает. Если у провайдера настроен доступ по списку IP-адресов, необходимо обратится в поддержку Tangl. |
| Неверный API-ключ | Ввести действующий ключ на странице Модель AI PDF. |
| Модель с таким именем не найдена | Проверить поле Модель: имя должно совпадать с именем у поставщика. |
| Поставщик отклонил запрос: проверьте имя модели и что модель принимает изображения и отвечает JSON | Необходимо убедится, что модель поддерживает изображения на входе и ответы в JSON. Модели, работающие только с текстом, не подходят. |
| Сохранённый ключ повреждён — введите его заново | Ввести API-ключ заново и сохранить настройки. |
| Для распознавания нужно настроить модель компании | Администратору компании следуетнастроить модель в разделе Модель AI PDF. |
| Сервис распознавания или шифрование ключей сейчас недоступны — попробуйте позже | Временная неполадка на стороне платформы. Следует повторить попытку позже. |
Мониторинг распознавания
Страница мониторинга показывает все распознавания PDF в компании: сколько их было, сколько прошло успешно, сколько заняло времени и какие ошибки встречались чаще всего.
Для перехода к странице:
В веб-сервисе Tangl Value нажать кнопку шестерёнки.
Выбрать пункт Мониторинг AI-обработки PDF.

Откроется страница Мониторинга распознавания.

Для детализации данных предусмотрены фильтры по временному периоду, текущему статусу и источнику.

Под панелью фильтров расположены информационные карточки с итогами за выбранный период:
- Всего конвертаций, Завершено, В обработке, С ошибкой;
- Доля успешных – процент завершившихся успешно;
- Среднее время распознавания одного файла;
- Страниц – сколько страниц обработано;
- Элементов в моделях – сколько элементов добавлено в модели.
Обособлено расположены карточки с графиком Динамика по дням: запущено, завершено, ошибок за каждый день и список Частые ошибки. 
Основную часть страницы занимает таблица со списком операций по распознаванию. Таблица содержит столбцы:
- Файл – имя загруженного PDF-документа, отправленного на распознавание;
- Источник – источника, из которого была инициирована задача;
- Статус – текущее состояние процесса. Может принимать значения: В очереди, В обработке, Завершено, Ошибка, Таймаут, Снято;
- Запущено – точные дата и время старта обработки файла;
- Длительность – общее время, затраченное нейросетью на чтение и распознавание документа от начала до завершения операции;
- Страницы – счётчик прогресса, отображающий количество считанных страниц по отношению к общему объему документа;
- Импорт в модель – итоговое количество успешно извлеченных данных и элементов, которые были перенесены в целевую модель;
- Ошибка – текстовое пояснение причины сбоя, отображаемое в случае, если задача не была успешно завершена.
В столбце Действия незавершённое распознавание можно Снять или Удалить при помощи соответствующих кнопок – так же, как в окне распознавания. Это удобно, когда нужно освободить очередь компании от большого документа, запущенного по ошибке.

Чтобы обновить данные, следует нажать кнопку Обновить в правом верхнем углу.

Частые вопросы
Почему я не вижу пункт «Загрузить .pdf как модель»?
Пункт виден только администраторам и менеджерам компании, для которой подключено AI-распознавание PDF. Если функция нужна, обратитесь в поддержку Tangl.
Кнопка «Запустить обработку» неактивна.
У компании не настроена модель LLM или её проверка не прошла. Попросите администратора компании открыть раздел Модель AI PDF, проверить подключение и сохранить настройки.
Распознавание долго стоит «в очереди».
У компании одновременно обрабатывается ограниченное число файлов. Остальные ждут и уходят в работу по мере освобождения мест. Если в очереди застрял ненужный документ, снимите его в окне распознавания или на странице мониторинга.
Можно ли распознать документ повторно?
Если распознавание завершилось ошибкой или было снято, нажмите Повторить в окне распознавания. Успешно распознанную версию повторно не распознают: чтобы получить новый результат, загрузите документ заново как новую модель.
Кто видит мой API-ключ?
Никто. После сохранения ключ хранится в зашифрованном виде и не возвращается ни в интерфейс, ни через API – видны только последние четыре символа.