Bollywood HungamaEXCLUSIVE: Shreyaa Chaudhry of Bandish Bandits fame to star opposite Ayushmann Khurrana in YRF and Posham Pa Pictures’ MupapaCNN Türkİran: ABD'nin 7 günlük planımıza ilişkin ilettiği mesajı inceliyoruzInquirer66-year-old man found dead under bridge in Oriental MindoroPunchWhy Ronaldo warm-up controversy escalated – Coach JesusThe Jerusalem PostPrince Andrew launches lawsuit against Thames Valley Police over Epstein-linked arrestESPN'Everything just clicked' with McMillan, Young in Panthers' primetime win한겨레영국 기지 배치된 미군 B-1 폭격기 12대, 미국으로 긴급 철수ZDF heuteAktuelle Pressemitteilungen des ZDFSky TG24Ragusa, sequestrati 377 animali esotici vivi protetti nel porto di PozzalloVarietyITV Studios Travels to Mipcom With 10 New Titles on Its Formats Slate, Led by ‘The Chase Around the World’ (EXCLUSIVE)NTVSon dakika deprem mi oldu? Az önce deprem nerede oldu? İstanbul, Ankara, İzmir ve il il AFAD son depremler 05 Ekim 2026Daily MailAnti-migrant protesters scuffle with police after nearly 150 small boat arrivals use 'new route' to land at historic naval port
The Daily Newsstand · Free, Always
Monday, October 5, 2026

Работа с текстом без LLM? Продолжаем развивать парсер Real AI SA

Translate

Итак, прошло уже больше 2х лет с момента моей последней статьи

Пора рассказать, что происходит в жизни проекта, сколько потратили денег на его реализацию и что получилось к текущему моменту.

Спойлер: потратили 8 000 000 рублей, внесли в базу знаний анализатора около 5000 понятий и провели бесплатный пилот.

Напомню, что в рамках проекта мы создаем семантический анализатор, предназначенный для построения графа из текста, работающий без больших языковых моделей (LLM).

А, собственно, почему не использовать LLM?

Сразу оговорюсь – мы не противопоставляем наш анализатор – Real AI SA – нейросетям и большим языковым моделям. Они действительно классные и могут автоматизировать выполнение многих рутинных задач.

Однако есть ситуации, когда невозможно использовать LLM или их результат будет далек от желаемого. Это могут быть случаи, когда:

  1. Присутствует необходимость 100% повторяемости результата без галлюцинаций и вольных трактовок.

  2. Нет возможностей для дообучения – нет массива размеченных данных, специалистов, вычислительных мощностей.

  3. Ограничения по финансам для использования LLM, как для покупки оборудования, так и для оплаты счетов на электричество.

  4. Ведется работа с конфиденциальными данными и присутствует запрет на передачу информации из внутреннего контура.

  5. Применение LLM выглядит избыточным для решения конкретной задачи по анализу текста.

В описанных выше сценариях и пригодится Real AI SA, который:

  • может быть запущен даже на старом ноуте, если у него есть от 4 гб оперативной памяти;

  • работает без доступа в интернет;

  • не требует гигабайтов размеченных данных для обучения.

Подробнее о механизме работы анализатора

Real AI SA находит в тексте понятия и определяет характер связей между ними, получая в итоге граф текста в формате JSON.

Визуально, модель для фразы «Приказываю начальнику службы качества Иванову И.И. аннулировать Распоряжение “О корреспонденции” №11-РП от 18.09.2022» может выглядеть вот так:

Визуальное представление модели фразы после обработки анализатором

Визуальное представление модели фразы после обработки анализатором

После того, как модель построена – из JSON можно извлекать нужную информацию. Например – номера упомянутых документов:

Фрагмент модели и соответствующий JSON

Фрагмент модели и соответствующий JSON

В чем фишка? Плюсы, минусы и подводные камни нашей технологии

Текст раскладывается по грамматическим и семантическим признакам, после чего все элементы разделяются на Действия, Свойства и Объекты.

Почему достаточно только указанных типов? Тут вступает в действие наша теория.

Человек, познавая окружающий мир, выполняет те или иные действия. На основании полученной обратной связи нами строится описание всего окружения. Следовательно, по аналогии, любой текст, как инструмент для хранения и обмена информацией, можно разложить по тому же принципу – на описание действий и их результатов (свойства). При этом объекты будут являться относительно постоянной совокупностью свойств.

Какие преимущества это дает? Вот, пожалуй, ключевые:

  1. Не требуется проработка онтологии предметной области. Возможность описания понятий без привязки к системе классов

  2. Легкое масштабирование

  3. Низкое требование к ресурсам для работы

  4. Возможность работы без доступа в интернет

  5. Проверяемый и повторяемый результат.

Разумеется, есть и ограничения:

  1. В настоящий момент анализатор работает только с текстом, а не сканами документов

  2. Текст должен быть на русском языке, хотя допускается использование иностранных названий и аббревиатур после дообучения

  3. Слова с ошибками или сленговые выражения скорее всего разберутся неправильно

  4. Отсутствие «common knowledge» - общеизвестных понятий и связей между ними. Эти знания можно заносить в систему, но пока их набор минимален.

  5. Анализатор находится в стадии развития и, скорее всего, потребуется наше участие в ходе его применения

Где мы уже принесли пользу

Практика – критерий истины. А значит от теории надо переходить к решению реальных задач.

Первый бизнес-сценарий, которые мы автоматизировали – извлечение матрицы поручений из приказов и распоряжений.

Задача была в том, чтобы снизить нагрузку на аппарат руководителя проекта. Существовал устойчивый процесс, когда через помощников руководителя проходили распорядительные документы, их надо было анализировать и передавать поручения ответственным через систему электронного документооборота (ЭДО).

В среднем на обработку одного документа уходило 7-10 минут.

Наше решение отлично ложилось на этот сценарий, так как он не содержал в себе ограничений, которые перечислили ранее – документы были написаны корректно, на русском языке, были в читаемом формате и не требовался перевод изображений в текстовую форму.

Суровое непубличное демо с приказами и извлекаемой из них информацией

Суровое непубличное демо с приказами и извлекаемой из них информацией

Единственное, что пришлось доработать – расширить базу знаний специфическими терминами и сокращениями из их предметной области.

В итоге получился модуль для существующей системы ЭДО, который автоматически выявлял поручения, сократив время работы почти в 40 раз до 15 секунд.

Пример извлечения структурированной информации из приказа

Пример извлечения структурированной информации из приказа

Задача решена, получен референс, однако больше одного пилота сделать не удалось. Почему? Сформулировали для себя ряд ограничивающих факторов:

  1. Задача по поручениям слишком локальная.

  2. Руководители не всегда заинтересованы в облегчении жизни подчиненных. Например мы слышали такой контраргумент на фразу, что сократим в 40 раз временные затраты – «И чего они будут делать в свободное время, чай пить?».

  3. Для эффекта от такого решения требуется организация с большим документооборотом. А значит – огромным количеством ЛПР, в том числе и не заинтересованных вообще ни в каких нововведениях, пока все и так работает.

  4. Опять же, про большие организации – существует рассинхронизация между тем, как отчитываются топам о работе и тем, как все работает на самом деле. Реальный пример, когда топы уверяли, что у них давно уже ИИ все анализирует, а мы, общаясь потом с исполнителями непосредственно внизу, видели этого замученного сотрудника, на которого были возложены функции ИИ.

К сожалению, бывает и так

К сожалению, бывает и так

Учитывая полученный опыт, сейчас развиваем анализатор для решения более серьезной задачи, актуальной уже не только для крупных корпораций, но и для среднего и малого бизнеса – инструмент, для поддержки в актуальном состоянии архива документов.

Вместо заключения

Уже сейчас семантический анализатор хорошо справляется с задачами, где нужна точность в анализе текста и повторяемость.

Как пример – сравнение морфологического разбора не самой простой фразы «Ушей это платье» Real AI SA и моделью claude-opus-5-medium:

В плане же технологии, достигнут любопытный результат и видны дальнейшие направления ее развития.

Основная проблема при использовании правил для анализа текста заключалась в жесткости применяемого объектно-ориентированного подхода и невозможности масштабирования придуманных онтологий. Пожалуй, наиболее масштабная попытка создать онтологию, где каждому анализируемому слову находилось бы место - это проект Compreno, который в итоге был закрыт.

Мы же в Real AI SA, отойдя от моделирования "сверху-вниз" и используя только базовые структурные элементы - действия - свойства - объекты, кажется, смогли обойти проблему резкого роста сложности и потребления ресурсов при расширения знаний системы за границы какой-то одной предметной области.

Сейчас анализатор знает около 5000 понятий, разрешает омонимию, эллипсисы, ссылки. Описание понятий же при этом остается достаточно компактным.

Как видно – технология явно имеет потенциал и было бы очень интересно узнать, с какими задачами по анализу текста сталкивалось хабрасообщество и видится ли перспектива применения семантического анализатора в этих задачах.

В конце-концов не сводить же все IT в 2026 году к агентам и LLM-wrapper’ам!

Да, на нашем сайте https://t2graph.ru есть возможность попробовать демо (без СМС и регистрации). Правда не чаще одного запроса в 5 секунд.

Если же хотите оценить применимость анализатора для ваших задач – пишите на info@real-ai.ru - организуем живую демонстрацию.

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.