В первых двух статьях цикла мы разобрались, почему нормативно-справочная информация (НСИ) неизбежно деградирует, почему простые алгоритмы сравнения строк проигрывают AI/ML, и как устроен сервис SOFROS AI/ML в целом — его архитектура, гибридный подход и интеграция с корпоративными системами через REST API.

Но методология и архитектура — это лишь верхушка айсберга. Главная магия происходит внутри моделей, которые отвечают за классификацию, извлечение характеристик, семантический поиск и контекстное обогащение данных. Именно они превращают «сырые» записи в структурированные и нормализованные справочники.

В третьей статье мы заглянем под капот этих моделей и подробно разберём:

- как работает модель классификации на основе наивного байесовского классификатора с учётом опечаток, n-грамм и нечёткого поиска;

- как модель экстракции выделяет именованные сущности (NER) с помощью spaCy и beam search;

- как модель семантического поиска использует BERT, FAISS и реранкер для поиска по смыслу;

- как модель контекстного поиска обращается к веб-источникам для дообогащения данных;

- зачем нужна классификация PII и как она обеспечивает безопасность.

Читать далее