OWL Сервис классификации и поиска документовβ
🏠 Как это работает
📤 Загрузка
🧠 Классификация документа
📊 История классификации
📖 Справочники
🗄️ Коллекция
⚙️ Настройки
🔌 API
Логотип

🤖 Как это работает?

Четыре простых сценария — от настройки до поиска. Нажми, чтобы развернуть.

⚙️ Настройка — один раз, чтобы система говорила на вашем языке
📖 Справочники (вкладка «Справочники») — замкнутые списки, из которых система обязана выбирать. Нейросети запрещено сочинять свои значения:
  • 🏷️ Тематики — перечень тем для классификации («МРГ 1279», «ФСТЭК», «ГИС ГМП»...). Чем точнее список, тем чётче разделение документов;
  • 🏢 Отправители — организации, от которых приходят письма. Реквизиты стандартизированы: «Минэк», а не «Министерство экономического развития РФ»;
  • 📬 Получатели — организации-адресаты;
  • 📥 Типы документов — письма, приказы, протоколы, соглашения...
⚙️ Параметры загрузки (Настройки → «📤 Загрузка»)
  • 📄 Лимит страниц загрузки (max_pages_load) — сколько первых страниц PDF обрабатывать при загрузке в хранилище. 0 = весь документ. Если документ длиннее лимита — сервис предупредит «в хранилище попадёт только начало». Полезно для больших файлов: экономит время распознавания;
  • 🏷️ Автотеги при загрузке (auto_tags) — записывать ли предложенные нейросетью теги сразу в хранилище, или вы решаете сами при проверке карточки.
🧠 Параметры классификации (Настройки → «Классификация»)
  • 🏷️ Предложения тегов (tag_suggestions) — показывать ли нейросетевые теги при классификации (бейджи в карточке результата);
  • 🎚️ Контраст (contrast) — 1..100, насколько резко «выпячивать» главную тематику: высокий контраст делает разницу между основной темой и остальными более драматичной (100 = почти всегда 100% у лидера), низкий — распределение вероятностей более ровное, когда темы похожи;
  • 🏷️ Учёт тегов (use_tags) — учитывать ли пересечение тегов документа с тегами похожих документов при расчёте сходства. Включите — если документы одной темы обычно помечены одинаковыми тегами;
  • 📈 Сила бонуса тегов (tag_boost) — 0..0.3, насколько сильно теги влияют на score: 0 = не влияют, 0.3 = существенно усиливают совпадение по тегам;
  • 📄 Лимит страниц классификации (max_pages) — сколько первых страниц распознавать для классификации нового документа (быстрее; 0 = все).
📝 Промпты (Настройки → «Промты») — тексты заданий для нейросети:
  • 📝 Реквизиты и содержание — извлечение даты, номера, отправителя, получателя, темы + краткое содержание (при загрузке);
  • 💡 Обоснование тематики — почему выбрана именно эта тема;
  • 📝 Краткое содержание (классификация) — summary для вкладки классификации;
  • 🏷️ Автотеги — генерация тегов-предложений.
🗄️ Коллекция (Настройки → «Коллекция») — резервные копии и точность поиска:
  • 📸 Создать снапшот — мгновенная резервная копия коллекции (≈1 сек, ~600 МБ). Рекомендуется после каждого массового наполнения;
  • ⬆️ Загрузить снапшот — восстановить коллекцию из копии (заменяет текущую! подтверждение перед запуском). Восстановление занимает 2–3 секунды;
  • 🗑 Удалить снапшот — освободить место (каждый ~600 МБ);
  • 💡 Зачем снапшоты: защищают от потери данных — например, при сбое или случайном удалении документов. Храните 2–3 последних;
  • 🎯 Порог точности поиска (0–100%) — фильтр для поиска по смыслу в коллекции: показываются только документы со сходством не ниже порога. 0% = без отсечки (показывать всё). Чем выше порог — тем меньше «мусора», но можно потерять погранично похожие документы. Рекомендация: 60–80%.
💡 Важно: к промптам «Реквизиты» и «Обоснование» сервис автоматически дописывает блок «ДОСТУПНЫЕ ЗНАЧЕНИЯ» из справочников — нейросеть обязана выбирать отправителя/получателя/тематику только из ваших списков. В редактируемый текст промпта этот блок не попадает.
📥 Наполнение коллекции — загрузите PDF, дальше всё само
Коллекция — семантическое хранилище: документы лежат «по смыслу» (векторами), у каждого — структурированная карточка. Каждый документ проходит цепочку статусов:
🕐
В очереди
Документ принят, ждёт распознавания
Распознавание
GPU читает PDF; если длиннее лимита — предупреждение
🧠
Анализ
Реквизиты + тематика по похожим документам
Готово
Карточка открыта для проверки и правок
📤
Загрузка в Qdrant
Эмбеддинг + запись в хранилище (виден прогресс %)
🚀
В хранилище
Терминальный ✅ — готов к поиску
Ошибка
Терминальный — с причиной; можно повторить
Отменено
Терминальный — остановлено вручную
🔴 Терминальные статусы — конечные точки жизненного цикла: документ больше не обрабатывается автоматически (🚀 в хранилище / ❌ ошибка / ⛔ отменено).
✏️ Редактирование метаданных — два уровня:
  • Карточка при загрузке (статус «✅ Готово»): открывается форма с полями — тематика, дата, номер, тип, отправитель, получатель, ссылка на документ, теги, краткое содержание. Правки сохраняются кнопкой «💾 Сохранить мету» до отправки в хранилище. Там же — кнопка «🚀 В Qdrant» (с проверкой дубликатов) и «🔁 Перезапустить воркер» при сбоях;
  • Прямо в коллекции (вкладка «Коллекция», статус «🚀 В хранилище»): у любого документа справа — карандашик ✏️. Открывается режим редактирования: те же поля (ссылка, тема, тип, дата, номер, отправитель, получатель) + теги (✕ удалить / «+» добавить) + 🗑 удалить документ. Изменения мгновенно пишутся во все фрагменты документа (даже если их 2500) и сразу доступны для поиска и классификации. Число чанков не редактируется — это факт хранения.
🧠 Классификация — для новых документов, которых ещё нет в хранилище
Процесс (автоматически, ~1–2 минуты):
  1. PDF распознаётся теми же OCR-мощностями;
  2. Текст превращается в векторы — числовые «отпечатки смысла»;
  3. Система ищет в хранилище документы с похожим смыслом;
  4. Тематика определяется статистически по соседям (теги усиливают сходство);
  5. Нейросеть пишет обоснование — почему выбрана именно эта тема;
  6. Готовится краткое содержание.
Результат — три карточки:
  • 📄 Информация о документе — превью первой страницы (живёт 2 минуты — защита от несанкционированного просмотра), ID задачи, имя, размер, краткое содержание, теги;
  • 📊 Результат классификации — 🎯 основная тематика с процентом уверенности, 💡 обоснование, 📈 возможные тематики, 🔍 похожие документы;
  • Оценка — вы оцениваете правильность, накапливается статистика качества.
Для разработчиков — открытый API (вкладка «🔌 API», Basic Auth):
POST /api/v1/classify — классификация PDF: тематика + обоснование + теги + соседи; возвращает task_id
POST /api/v1/eval    — оценка результата по task_id (1 = верна, 2 = среди предлагаемых, 3 = нет верной)
GET  /api/v1/health   — проверка доступности
💡 Каждая классификация (и из UI, и из API) попадает в «Историю классификации» с пометкой источника — оценки можно выставлять и там, и через API.
🔍 Поиск — три способа найти документ
СпособКак работаетПример
🎯 По смыслуФраза или вопрос превращаются в вектор — находятся документы с похожим содержанием, даже если слова не совпадают«продление лицензии на ветеринарную деятельность» найдёт письма об этом другими словами
🏷️ По тегамТочное совпадение метоквсё с тегом «срочно»
📋 По реквизитамФильтры по структурированным полямтематика = «ФСТЭК» + отправитель = «Минэк» + дата за период
💡 Фильтры комбинируются. А блок «Похожие документы» в классификации — тот же поиск по смыслу, применённый автоматически.

📊 Статистика сервиса

🏷️ Тематик в базе
📄 Документов в коллекции
🧠 Проведено классификаций

1️⃣ Загрузи PDF

Перетащи PDF сюда или нажми для выбора
распознавание через Marker OCR