Альтернативный подход к отраслевой классификации публичных компаний на основе текстовой кластеризации: эмпирическое исследование на данных NASDAQ

Ветрова М.А.1 , Купоров В.С.2 , Горкавцев М.О.3
1 Санкт-Петербургский государственный университет, Санкт-Петербург, Россия
2 VERSUS, Санкт-Петербург,, Россия
3 Технологии Доверия - Консультирование, Санкт-Петербург, Россия

Статья в журнале

Информатизация в цифровой экономике (РИНЦ, ВАК)
опубликовать статью | оформить подписку

Том 7, Номер 2 (Апрель-июнь 2026)

Цитировать эту статью:

Аннотация:
Экспертные отраслевые классификаторы (GICS на международных рынках, ОКВЭД в Российской Федерации) лежат в основе большинства эмпирических исследований в финансах и экономике, однако плохо отражают гибридные бизнес-модели, возникающие в результате цифровой трансформации. Цель исследования – разработать и апробировать воспроизводимый индуктивный подход к группировке компаний на основе их текстовых самоописаний, оптимизирующий соотношение качества кластеризации и вычислительной экономичности. На выборке 3 380 публичных компаний, торгующихся на бирже NASDAQ, применена методологическая связка: эмбеддинги Sentence-BERT (модель all-MiniLM-L6-v2) без дообучения, снижение размерности методом главных компонент и кластеризация алгоритмом k-средних. Устойчивость результатов подтверждена тремя независимыми способами: двумя альтернативными конфигурациями (без снижения размерности и через плотностную кластеризацию UMAP+HDBSCAN), формальными метриками согласия с GICS (скорректированный индекс Рэнда 0,46, средняя чистота 61,4%) и финансовым профилем кластеров по семи показателям, не участвовавшим в построении кластеров. Получены шесть содержательно интерпретируемых групп: два кластера (клинические биотехнологии и коммерческие банки) воспроизводят отраслевую структуру с чистотой 97-98%, два других выявляют структурные феномены, неразличимые в GICS (компании-оболочки в рамках сделок слияния и поглощения и потребительский гибрид, объединяющий ритейл с B2C-платформами). Предложенная методология обладает высокой воспроизводимостью, не требует дообучения модели и применима для уточнения отраслевой структуры на данных российских компаний с использованием ОКВЭД в качестве референсной классификации.

Ключевые слова: отраслевая классификация, текстовая кластеризация, Sentence-BERT, метод k-средних, GICS, цифровая трансформация

JEL-классификация: G14, C38, L25

JATS XML



Введение

Во многих исследованиях компаний, где необходимо определить отрасль или сферу деятельности, применяются уже готовые отраслевые классификаторы: в США это чаще всего GICS (Global Industry Classification Standard) или SIC (Standard Industrial Classification), в России – ОКВЭД 2 (Общероссийский классификатор видов экономической деятельности). Эти классификаторы устроены по похожим принципам: эксперты относят каждую компанию к какой-либо категории, ориентируясь на основной продукт, базовую технологию или используемое сырье.

Такая логика хорошо работает для стабильных отраслей с относительно понятными границами. Однако цифровая трансформация усложняет отраслевую идентификацию компаний, поэтому распространение платформенных и экосистемных бизнес-моделей приводит к тому, что компании одновременно соединяют разные группы участников рынка, развивают дополнительные сервисы и могут менять целые отрасли. Это затрудняет отнесение отдельных компаний к одной традиционной отраслевой категории [1] (Gorda, 2025). Эксперты, обновляющие классификаторы раз в несколько лет, не успевают за этой динамикой, а иногда и формально присвоенный код не соответствует фактической деятельности.

Для российского контекста близкая проблема обсуждается применительно к ОКВЭД, так как классификатор должен формализовать реально существующие виды экономической деятельности, однако его применение осложняется учетом многопрофильных компаний и несоответствием между классификационной сеткой и фактической структурой деятельности хозяйствующих субъектов [2] (Kozyr et al., 2017).

Альтернативный путь заключается в том, что можно отказаться от попытки заранее задать категориальную сетку и сформировать группы непосредственно из данных. Логичный источник данных здесь – это тексты, в которых компании сами описывают свой бизнес: соответствующие разделы в годовых отчетах, пояснения к финансовой отчетности или описания на корпоративных сайтах. Если две компании в этих описаниях используют схожий язык, они с высокой вероятностью занимаются схожей деятельностью, независимо от того, какие коды им присвоены формально.

Цель настоящего исследования заключается в разработке и апробации прикладного подхода к текстовой кластеризации компаний, оптимизирующего соотношение воспроизводимости и качества.

При этом эмпирической базой выступают компании листинга NASDAQ, так как американский рынок наиболее динамичен с точки зрения трансформации бизнес-моделей, а также обеспечивает доступность стандартизованных текстовых описаний и развитую инфраструктуру финансовой отчетности, что позволяет проверить результаты сразу несколькими способами.

Обзор литературы

Классификации по типу SIC, GICS и NAICS (North American Industry Classification System) страдают от трех структурных ограничений: одномерности (компания получает один код), статичности (классификации обновляются периодически и могут отставать от быстрых изменений бизнес-моделей) и непрозрачности процедуры присвоения [11] (Kim et al., 2022).

Применение текстового сходства корпоративных самоописаний для измерения близости фирм имеет в финансовой литературе длительную традицию. В ранней работе Дж. Хоберг и Г. Филлипс использовали попарное сходство продуктовых описаний из годовых отчетов 10-K для анализа слияний и поглощений, показав, что сделки чаще происходят между компаниями с похожим языком описания продуктов [8] (Hoberg et al., 2010).

Позднее Дж. Хоберг и Г. Филлипс предложили строить отраслевые группы непосредственно из текста: считать попарное сходство между описаниями продуктов в разделе Business годовых отчетов 10-K и формировать на этой основе сетевую отраслевую структуру (Text-based Network Industry Classifications, TNIC). Главным результатом стала сетевая классификация TNIC, которая лучше, чем SIC и NAICS, объясняет конкурентную среду фирмы, а также наблюдаемые различия в R&D, рекламе, прибыльности и левередже [9] (Hoberg et al., 2016). Эта работа внесла ощутимый вклад в развитие текстовых подходов как возможной альтернативы экспертным классификациям.

Следующий этап развития текстовых отраслевых классификаций связан с переходом от лексических мер сходства к векторным представлениям корпоративных описаний. Так, Х. Янг и соавторы предложили BTIC (Business Text Industry Classification), где описания бизнеса компаний S&P 500 из годовых отчетов 10-K преобразуются в doc2vec-векторы, а затем группируются с помощью иерархической кластеризации Уорда [18] (Yang et al., 2016). Эта линия исследований показала, что отрасль можно восстанавливать не только через экспертный код, но и через семантическую близость описаний деятельности компаний.

Развитие трансформерных моделей усилило этот подход. BERT (Bidirectional Encoder Representations from Transformers) использует двусторонний контекст для построения языковых представлений [7] (Devlin et al., 2019), а Sentence-BERT адаптирует BERT для получения семантически осмысленных эмбеддингов предложений и документов, сходство которых можно сравнивать [15] (Reimers et al., 2019). На этой основе современные работы переходят от словарных признаков к плотным семантическим векторам корпоративных описаний.

Например, Д. Вамвуреллис с соавторами сравнили BERT, Longformer, SBERT, GPT- и PaLM-эмбеддинги на 2 590 компаниях из Russell 3000, используя описания бизнеса из Item 1 отчетов 10-K. Их результаты показывают, что дообученный SBERT хорошо воспроизводит GICS-сектора, достигая точности около 90%, а лучшие кластеры на основе LLM-эмбеддингов объясняют месячные доходности лучше, чем GICS, с R² 0,119 против 0,106 [16].

Параллельно развиваются и другие направления. Т. Ягрич и А. Херман показали, что дообученный BERT может классифицировать описания компаний по 13 отраслевым категориям с accuracy 88,23% и F1-score 0,88 [10] (Jagrič et al., 2024). М. Папенков и соавторы предложили Multi-Industry Simplex, вероятностное расширение GICS, в котором компания может быть отнесена сразу к нескольким индустриям с разными вероятностями [14]. Х. Бай и соавторы, в свою очередь, предложили метод построения иерархической бизнес-таксономии для развивающихся рынков на основе концептов, извлеченных из годовых отчетов компаний [6] (Bai et al., 2019).

В русскоязычной литературе работы по автоматическому построению отраслевых групп компаний на основе текстов единичны. Ближе всего к этой задаче исследования по интеллектуальному анализу корпоративной отчетности.

П.А. Михненко анализирует трансформацию деловой лексики годовых отчетов крупнейших российских компаний за 2018–2020 гг. методами Data Mining. Компании в этой работе кластеризуются по лексической близости отчетов, что методологически роднит ее с текстовыми подходами к сопоставлению компаний. Но в данном случае цель иная: зафиксировать изменения в деловой лексике и стратегических ориентирах, а не построить альтернативную отраслевую классификацию [4] (Mikhnenko, 2022).

Более современный пример применения схожих подходов анализа к российской корпоративной отчетности представлен в работе Е. А. Федоровой и П.А. Сальниковой. Авторы анализируют годовые отчеты 100 крупнейших по выручке публичных компаний России за 2019–2022 гг. и используют LDA и BERTopic для выделения тематических групп, связанных с раскрытием экологических инициатив. Эта работа важна для настоящего исследования не как пример отраслевой классификации, а как подтверждение того, что современные трансформерные подходы уже применяются к корпусу годовых отчетов российских публичных компаний [5] (Fedorova et al., 2024).

Другой пример – это работа Е.Ю. Макеевой и И.В. Аршавского, где семантический анализ годовых отчетов применяется для прогнозирования финансовой несостоятельности. Она также демонстрирует, что текст отчетности может выступать самостоятельным источником аналитических признаков наравне с финансовыми показателями. Задачу отраслевой группировки эта работа также не ставит [3] (Makeeva et al., 2014).

В итоге в русскоязычной литературе пока нет сложившегося направления текстовой отраслевой классификации, но есть отдельные смежные работы по анализу корпоративных текстов.

Можно сделать вывод, что большая часть современной литературы либо использует ресурсоемкие конфигурации (большие языковые модели, нестандартные алгоритмы кластеризации и т.д.), либо ограничивается классическими словарными представлениями. Промежуточная зона в формате готовых предобученных эмбеддингов без дообучения в связке с классической кластеризацией освоена недостаточно. Кроме того, акцент в существующих работах смещен на достижение наилучшей метрики (например, корреляции доходностей или прогнозировании финансовой несостоятельности), а не на содержательный анализ того, где и почему текстовая классификация расходится с экспертной.

Методология

Эмпирическая выборка включает 3 380 публичных компаний, торгующихся на бирже NASDAQ. Этот рынок выбран намеренно: технологическая и биотехнологическая направленность индекса создает высокую концентрацию гибридных бизнес-моделей (платформы, цифровые экосистемы, финтех), которые плохо вписываются в традиционные отраслевые классификаторы. Для каждой компании собрано два типа информации на основании Yahoo Finance: текстовое описание бизнеса и развернутая финансовая отчетность за 2024 год. Источником текстов являются бизнес-описания из Yahoo Finance (100–300 слов) [17]. Эти описания основаны на разделе Item 1 («Business») годовых отчетов 10-K, но представляют собой стандартизированную, концентрированную версию, очищенную от юридических и риск-нарративов. Короткий формат обеспечивает высокое отношение сигнал/шум и упрощает воспроизводимость подхода без потери семантической релевантности. Каждая компания также имеет официальный код по классификации GICS, агрегированный до уровня сектора.

Распределение по секторам неравномерно: доминируют Healthcare (941 компания, 27,8% выборки), Financial Services (602; 17,8%) и Technology (578; 17,1%). Малые сектора (Energy, Utilities, Real Estate, Basic Materials) представлены менее чем 7% каждый. Эта асимметрия учитывается при выборе числа кластеров: попытка воспроизвести все 11 секторов привела бы к переобучению на малых группах.

Каждое текстовое описание преобразовано в плотный вектор размерности 384 с помощью модели Sentence-BERT в конфигурации all-MiniLM-L6-v2. Эта модель выбрана по трем причинам: она компактна и быстра, имеет открытый доступ и не требует дообучения для семантических задач, при этом ее эмбеддинги хорошо изучены в задачах кластеризации текстов [15] (Reimers et al., 2019). В отличие от классических словарных представлений, эмбеддинги SBERT улавливают семантическую близость на уровне смысла, а не лексики, поэтому, например, два банковских описания будут сближены, даже если используют разную терминологию.

Для последующей кластеризации эмбеддинги спроецированы в пятимерное подпространство методом главных компонент (PCA). Выбор пяти компонент сделан эмпирически: тестирование размерности от 5 до 30 показало, что максимальное значение силуэтного коэффициента (0,33) достигается при пяти компонентах, а дальнейшее увеличение размерности снижает качество кластеризации (при 10 компонентах силуэт падает до 0,23, при 20 – до 0,17). При этом низкая доля объясненной дисперсии (18,7% для пяти компонент) не противоречит качеству кластеризации: первые пять компонент улавливают наиболее контрастные семантические различия между описаниями, что на этапе результатов подтверждается содержательной интерпретацией полученных кластеров, где два из шести демонстрируют чистоту выше 97% по доминирующему GICS-сектору.

На полученных пятимерных представлениях применен алгоритм k-средних с числом кластеров k = 6. Выбор k обоснован двумя соображениями. Первое заключается в тестировании значений от 4 до 12 по силуэтному коэффициенту, что дало локальный максимум в районе k = 6. Во-вторых, с содержательной точки зрения шесть кластеров обеспечивают разумный компромисс между детализацией и интерпретируемостью при 11 секторах GICS в выборке. Более низкие значения k (2–3) дают более высокие показатели силуэтного коэффициента (0,36 при k=3), однако ведут к чрезмерной агрегации, объединяя семантически различные группы. Такое «схлопывание» противоречит цели исследования – выявить содержательные расхождения между текстовой группировкой и экспертной классификацией.

Таким образом, итоговое значение силуэтного коэффициента составляет 0,33. Это указывает на умеренную, но не высокую разделимость кластеров. Такая величина не является аномально низкой для задач семантической кластеризации текстов. Так, например, в сравнительном исследовании SBERT-кластеризации длинных документов значения силуэтного коэффициента для k-средних в разных конфигурациях также находились преимущественно в умеренном диапазоне – 0,3–0,45 [13] (Ortakci et al., 2025). Поэтому в данном исследовании значение 0,33 интерпретируется не как самостоятельное доказательство высокого качества разбиения, а как один из признаков частичной разделимости текстового пространства, который должен оцениваться совместно с содержательной интерпретацией кластеров, согласованностью с GICS и финансовой поствалидацией.

Поскольку результат кластеризации может зависеть от конкретной конфигурации, проведены две независимые проверки. Для начала была проведена кластеризация k-средних на исходных нормализованных 384-мерных эмбеддингах без снижения размерности (то есть без применения PCA). Силуэтный коэффициент здесь существенно ниже (0,06), однако содержательный состав кластеров сохраняется: доминирующие группы (компании в сфере медицины, банки, финансовые компании) идентифицируются теми же ключевыми словами и теми же фирмами. Это подтверждает, что выявленная структура связана именно со свойством данных, а PCA позволяет избавиться от шума в тексте и более четко выделить смысловые направления, по которым отличаются кластеры.

Вторая проверка принципиально иная по типу, так как была использована проекция UMAP (Uniform Manifold Approximation and Projection) [12] с последующей плотностной кластеризацией HDBSCAN, в рамках чего выделяются только естественные плотностные кластеры. Результатом является один четкий кластер – биотехнологии (856 компаний), остальные 10 секторов GICS сливаются в единое облако (2326 компаний), а 6,7% точек помечены как шум. Это подтверждает лексическую разницу в данных между секторами, однако низкое число кластеров (2), определенное HDBSCAN, делает результат менее подходящим для прикладных задач, требующих более детального разбиения компаний, а UMAP крайне чувствителен к заданным гиперпараметрам (n_neighbors, min_dist), что затрудняет воспроизводимость метода.

Для каждого полученного кластера определены характерные термины, которые являются наиболее весомыми и распространенными в рамках описаний компаний внутри одного кластера, через TF-IDF (Term Frequency – Inverse Document Frequency). Для расчета TF-IDF стоп-слова были удалены, чтобы выделить содержательные термины. При получении эмбеддингов удаление стоп-слов не требовалось, так как трансформерные модели (Sentence-BERT) самостоятельно снижают их влияние через механизм внимания, фокусируясь на семантически значимых словах. Также в рамках исследования проводится финансовая валидация через сравнение распределений семи показателей по кластерам: рентабельности активов (ROA), рентабельности собственного капитала (ROE), маржи свободного денежного потока (FCF Margin), отношения долга к капиталу (D/E), маржи EBITDA, коэффициента текущей ликвидности (Current Ratio) и темпа роста выручки. Для повышения устойчивости к выбросам показатели были ограничены на уровне 1-го и 99-го процентилей, после чего рассчитаны медианы по кластерам. Поскольку финансовые показатели в процедуру кластеризации не вводились, их систематическое различие по кластерам служит независимым подтверждением экономической содержательности разбиения.

Результаты

Полученное разбиение демонстрирует умеренный уровень соответствия классификации GICS: скорректированный индекс Рэнда составляет 0,46, гомогенность – 0,42, полнота – 0,48, средняя взвешенная чистота кластеров – 61,4%. Эти значения говорят о том, что текстовая структура улавливает существенную часть отраслевой дифференциации, однако проводит границы по-другому. Дисбаланс между гомогенностью и полнотой указывает на конкретный паттерн расхождений: кластеры в среднем шире секторов, то есть охотнее собирают компании из разных секторов, чем дробят один сектор на несколько кластеров, что продемонстрировано на рисунке 1. Исключением является сектор Financial Services, который раскалывается надвое. Наиболее чистый кластер 1, который практически полностью относится к здравоохранению.

Рисунок 1. Распределение GICS кодов по текстовым кластерам

Источник: составлено авторами.

Шесть полученных кластеров заметно различаются по размеру, отраслевой чистоте и финансовому профилю. Краткая сводка приведена в таблицах 1 и 2.

Таблица 1 Структура полученных кластеров

Кластер
Интерпретация
Размер
Крупнейший GICS Сектор
1
Клинические биотехнологии
812
Healthcare (98,5%)
2
Программные технологии
652
Technology (59,2%)
3
Материальная экономика
518
Industrials (35,5%)
4
Инвестиционные компании и M&A-структуры
477
Financial Services (46,3%)
5
Банковская деятельность
335
Financial Services (97,0%)
6
Потребительский сегмент
586
Consumer Cyclical (32,1%)
Источник: составлено авторами на основе результатов кластеризации.

Таблица 2 Финансовый профиль полученных кластеров (медианы)

Кластер
ROA
EBITDA Margin
FCF
Margin
Current ratio
1
-0,39
-0,93
-0,78
3,99
2
-0,04
0,03
0,03
1,70
3
0,006
0,075
0,00
1,89
4
-0,009
0,061
-0,01
1,32
5
0,009
0,097
0,28
1,98
6
-0,001
0,056
0,01
1,51
Источник: составлено авторами на основе результатов кластеризации и финансовой отчетности компаний за 2024 год.

Кластер 1 клинические биотехнологии. Самый плотный и предсказуемый из шести. Чистота 98,5% по сектору Healthcare: из 812 компаний 800 относятся к этому сектору. Топ ключевых слов – treatment, clinical, phase, therapeutics, cancer, trial, patients, diseases – однозначно описывает фармацевтику и биотехнологии на доклинической и клинической стадиях разработки. Финансовый профиль идеально соответствует этой содержательной интерпретации: компании демонстрируют экстремально отрицательную медианную рентабельность активов (ROA -0,39), сильно отрицательную маржу свободного денежного потока (FCF Margin -0,78) и аналогично отрицательную маржу EBITDA (-0,93). Минимальная долговая нагрузка (D/E около 0,08) и высокий коэффициент текущей ликвидности (3,99) указывают на классическую модель финансирования таких компаний: накопленная наличность от размещений акций и раундов финансирования при отсутствии операционного денежного потока. Принципиально важно, что финансовая картина воспроизведена без участия финансовых показателей в кластеризации, что значит, что алгоритм нашел биотехнологические компании исключительно по тексту.

Кластер 2 технологии и цифровые платформы. Объединяет 652 компании с топ-словами software, data, platform, cloud, ai, digital, security, mobile. Доминирует сектор Technology (386 компаний, 59,2%), однако кластер также включает крупные цифровые платформы, формально отнесенные GICS к другим секторам: Amazon (Consumer Cyclical), Alphabet. Содержательно кластер описывает компании, чья бизнес-модель строится вокруг программного обеспечения, данных и сетевых эффектов, независимо от того, продают ли они конечным потребителям или бизнесу. Финансовый профиль умеренно отрицательный (ROA -0,04), что соответствует структуре сектора с большой долей растущих компаний, еще не вышедших на устойчивую прибыльность.

Кластер 3 – промышленность, энергетика и высокотехнологичное производство. Объединяет 518 компаний с топ-словами energy, power, equipment, gas, industrial, oil, electric, water, manufactures. В числе крупнейших компаний кластера – Tesla (электромобили и энергетические решения), Honeywell (промышленная автоматизация), Linde (промышленные газы), ASML и Applied Materials (производство полупроводникового оборудования), Baker Hughes (нефтегазовое оборудование). Состав отражает широкий спектр от классической тяжелой промышленности до высокотехнологичного производства чипов и оборудования для них. Финансовый профиль соответствует зрелому операционному бизнесу: положительная рентабельность активов (ROA 0,006), умеренная маржа EBITDA (0,075) соответствует крупным представителям физической экономики.

Кластер 4 – инвестиционные компании и M&A-структуры. Это один из наиболее интересных методологических результатов. Формально доминирует сектор Financial Services (221 компания, 46,3%), однако ключевые слова описывают совершенно иную реальность: acquisition, share, asset, new york, merger, exchange, reorganization. Это типичный язык SPAC (Special Purpose Acquisition Company) – корпоративных структур без операционной деятельности, созданных для слияния с целевой компанией. Наряду с классическими SPAC в кластер попадают также инвестиционные компании и брокерские платформы: StoneX Group, Interactive Brokers, Coinbase, eToro. Несмотря на наличие у последних реальной операционной деятельности, их бизнес-описания (ключевые слова investment, trading, exchange, broker) семантически ближе к SPAC-лексике, чем к традиционным банкам из кластера 5. Финансовый профиль подтверждает наблюдения выше – все операционные показатели близки к нулю (ROA -0,009, FCF Margin -0,01).

Кластер 5 – банки и финансовые услуги. Второй после биотехнологий почти моноотраслевой кластер: 325 из 335 компаний относятся к Financial Services, чистота 97%. Ключевые слова – loans, banking, deposit, commercial, accounts, bank, credit, real estate – описывают коммерческое банковское дело. В числе крупнейших компаний Grupo Financiero Galicia, Arch Capital Group (страхование), Principal Financial, LPL Financial. Присутствие страховых компаний и инвестиционных фондов в этом кластере ожидаемо, так как их бизнес-описания используют ту же финансовую лексику, что и банки. Финансовый профиль однозначен: положительная рентабельность собственного капитала (ROE 0,085), наивысшая среди кластеров долговая нагрузка (D/E около 0,49). Положительная рентабельность при высоком плече – это и есть банковско-страховой профиль. Важный вывод: сектор Financial Services в GICS объединяет банки, страховые компании, SPAC и инвестиционные фонды, тогда как текстовая кластеризация уверенно разводит их на два кластера (4 и 5).

Кластер 6 – ритейл, потребительские товары и B2C-платформы. Данный кластер является самым разнородным из шести выделенных. Чистота 32,1% по доминирующему сектору Consumer Cyclical. В числе крупнейших компаний JD.com и PDD Holdings (онлайн-ритейл), Costco (розничная торговля), PepsiCo (продукты питания), Starbucks (ресторанный бизнес), Marriott (гостиничные услуги), а также B2C-платформы – PayPal (цифровые платежи) и MercadoLibre (латиноамериканский маркетплейс). Топ-слова (food, sells, brand, brands, stores, online) указывают на ориентацию на конечного потребителя через бренды, физические или онлайн-каналы продаж. Финансовый профиль умеренный (ROA -0,001, EBITDA Margin 0,056), что соответствует массовому потребительскому сектору с тонкой маржой. Низкая отраслевая чистота этого кластера – не методологический сбой, а отражение объективной размытости потребительского сегмента в современной экономике.

На рисунке 2 представлена двумерная проекция t-SNE текстовых эмбеддингов 3 380 компаний NASDAQ. Левая панель окрашена по секторам GICS, правая – по результатам текстовой кластеризации. Биотехнологический кластер (кластер 1) образует компактное и четко изолированное облако в правой части пространства, что является визуальным подтверждением его 98,5%-ной чистоты. Аналогичным образом выделяется облако в нижней части пространства, соответствующее кластеру классических финансовых услуг (кластер 5). Остальные четыре кластера занимают перекрывающиеся области, что соответствует умеренному силуэтному коэффициенту (0,33) и отражает градиентный, а не дискретный характер отраслевых границ в семантическом пространстве самоописаний. Сравнение двух панелей показывает, что там, где текстовые и GICS-границы совпадают (биотех, банки), раскраски визуально согласуются, а там, где расходятся (потребительский сегмент, промышленность), цветовые паттерны различаются.

Рисунок 2. Двумерная t-SNE-проекция текстовых эмбеддингов (PCA 5): сравнение GICS-секторов и текстовых кластеров

Источник: составлено авторами.

Результаты альтернативных подходов (k-средних без PCA и UMAP+HDBSCAN), описанные в методологии, также подтверждают основные наблюдения. Эксперимент с k-средними на полных 384-мерных эмбеддингах сохраняет содержательный состав кластеров, хотя силуэтный коэффициент снижается. Эксперимент с k-средними на пятимерной PCA-проекции дает детализированную картину из шести кластеров. Эксперимент с UMAP и плотностным алгоритмом HDBSCAN выявляет одну принципиальную плотностную границу – биотехнологический сектор, изолированный от остального рынка, и показывает, что внутри прочей части выборки NASDAQ отраслевая структура не имеет резких границ. Этот третий результат имеет самостоятельное экономическое значение. Он означает, что разделение современного рынка на десять отраслей вне сектора Healthcare – это во многом экспертная конвенция, не имеющая четкой эмпирической поддержки в текстах самоописаний компаний. Алгоритмы с заданным числом кластеров вроде k-средних эту градиентную структуру преобразуют в дискретные группы, а плотностные алгоритмы – нет. Оба результата корректны, но они отвечают на разные вопросы. Для прикладных задач (отраслевые контроли в регрессиях, выбор сопоставимых компаний для оценки) полезнее категориальное разбиение, для аналитических задач (выявление гибридных бизнес-моделей, мониторинг структурных сдвигов) – то есть плотностная диагностика. 6,7% компаний, получивших метку шума в эксперименте с HDBSCAN, представляют практический интерес как первичный список кандидатов для качественного анализа аномалий.

Для поствалидации использовались финансовые показатели, что независимо подтвердило экономическую содержательность кластеров. Распределения ROA, EBITDA Margin и FCF Margin резко различаются между кластерами 1 (биотехнологии) и 5 (банки), причем в направлениях, согласующихся с содержательной интерпретацией. Распределение рентабельности активов в рамках каждого кластера представлено на рисунке 3.

Рисунок 3. Распределение ROA по кластерам

Источник: составлено авторами.

Вместе с тем нужно прямо обозначить ограничения этой валидации. Для биотехнологических компаний и банков она исключительно сильна: экстремальные значения метрик однозначно идентифицируют тип бизнеса. Для кластеров 2, 3, 4 и 6 различия в медианах меньше, а распределения сильно перекрываются. Это не отменяет валидации, но показывает ее предел: финансы подтверждают крайние типы, в середине спектра компаний различия носят стохастический характер. Кроме того, отдельные финансовые показатели (FCF Margin, Current Ratio) для банковских организаций имеют ограниченную сопоставимость с производственными компаниями из-за особенностей структуры активов и обязательств финансовых посредников, поэтому для строгого сравнения по этим показателям банковский кластер следует анализировать отдельно.

Заключение

Исследование показало, что готовые предобученные эмбеддинги Sentence-BERT в связке с классической кластеризацией k-средних на пятимерной PCA-проекции дают воспроизводимый и содержательно интерпретируемый подход к отраслевой группировке публичных компаний. На выборке 3 380 компаний NASDAQ получены шесть кластеров, формально согласующиеся с классификацией GICS на уровне ARI 0,46 и средней чистоты 61,4%. При этом два кластера (биотехнологии и коммерческие банки) воспроизводят отраслевую структуру с чистотой 97–98%, а еще четыре дают содержательно осмысленные группировки на стыке нескольких формальных секторов.

Ключевые методологические выводы работы можно сформулировать тремя пунктами.

Во-первых, подход устойчив. Согласованность результатов трех независимых конфигураций (k-средних на PCA-5, k-средних на полных эмбеддингах, UMAP+HDBSCAN) показывает, что выявленная структура отражает свойства данных, а не артефакт конкретной настройки параметров.

Во-вторых, расхождения с GICS интерпретируемы и содержательно ценны. Выделение SPAC-структур в отдельный кластер, объединение разнородных по GICS потребительских компаний в один кластер по потребительской природе бизнеса, лексическая близость промышленных и технологических компаний на стыке индустриального программного обеспечения – все это не методологические сбои, а диагностика конкретных мест, где экспертная классификация делает реальность более грубой.

В-третьих, финансовая валидация через семь независимых показателей подтверждает экономическую содержательность кластеров. Компании, попавшие в один текстовый кластер, ведут систематически схожий тип бизнеса, что снимает базовое возражение «текстовая близость не равна экономической близости».

С точки зрения практической применимости подход имеет три преимущества над более сложными конфигурациями, представленными в литературе. Первое – это воспроизводимость, так как модель открыта, не требует дообучения, кластеризация выполняется стандартными библиотеками. Второе – это вычислительная экономичность, ведь эмбеддинги для выборки из нескольких тысяч компаний строятся на обычном вычислительном оборудовании за разумное время. И третьим фактором является интерпретируемость: каждый кластер описывается через ключевые слова, что делает результат понятным для содержательного анализа без обращения к специализированным методам интерпретации сложных моделей.

Перспективы дальнейшей работы естественным образом делятся на два направления. Во-первых, необходимо проводить более детальный анализ аномалий. В дополнительном эксперименте с UMAP+HDBSCAN около 6,7% компаний были отмечены как шум, что значит, что эти компании могут быть кандидатами на изучение гибридных бизнес-моделей. Второе и более важное – перенос методологии на данные российских публичных компаний с использованием ОКВЭД в качестве референсной классификации. Архитектура данного подхода полностью переносима, в качестве источника текстов могут выступать описания деятельности компаний и их официальные сайты, а в качестве модели эмбеддингов – мультиязычные варианты Sentence-BERT, поддерживающие русский язык. Такой перенос позволил бы оценить, насколько ОКВЭД согласуется с реальной картиной деятельности российских компаний и где именно проходят границы его применимости. Это направление видится особенно актуальным в условиях активной цифровой трансформации отечественной экономики, когда классические отраслевые категории все чаще оказываются недостаточными для описания реальных бизнес-моделей.

В более широком плане работа показывает, что современные текстовые методы открывают новый класс инструментов для эмпирической экономики и финансов – инструментов, которые не заменяют экспертные классификации, а дополняют их там, где экспертная категоризация структурно ограничена. Это особенно важно в эпоху быстрой трансформации бизнес-моделей, когда границы между отраслями становятся все более условными, а потребность в гибких аналитических категориях – все более ощутимой.


Источники:

1. Горда А.С. Цифровая трансформация бизнес-моделей предприятий в сфере розничной торговли // Омский научный вестник. Серия Общество. История. Современность. – 2025. – № 4. – c. 120-126. – doi: 10.25206/2542-0488-2025-10-4-120-126.
2. Козырь Н.С., Коваленко В.С. Метрика отраслевой классификации в Российской Федерации и за рубежом // Экономический анализ: теория и практика. – 2017. – № 10(469). – c. 1914-1927. – doi: 10.24891/ea.16.10.1914.
3. Макеева Е.Ю., Аршавский И.В. Применение нейронных сетей и семантического анализа для прогнозирования банкротства // Корпоративные финансы. – 2014. – № 4(32). – c. 130-141. – doi: 10.17323/j.jcfr.2073-0438.8.4.2014.130-141.
4. Михненко П.А. Трансформация деловой лексики годовых отчетов крупнейших российских компаний: Data Mining // Управленец. – 2022. – № 5. – c. 17-33. – doi: 10.29141/2218-5003-2022-13-5-2.
5. Федорова Е.А., Сальникова П.А. Влияние раскрытия информации об экологических инициативах на цены акций публичных компаний России // Экономический журнал. – 2024. – № 2. – c. 223-247. – doi: 10.17323/1813-8691-2024-28-2-223-247.
6. Bai H., Xing F. Z., Cambria E., Huang W.-B. Business Taxonomy Construction Using Concept-Level Hierarchical Clustering // Proceedings of the First Workshop on Financial Technology and Natural Language Processing. Macao, China, 2019. – p. 1-7.– doi: 10.48550/arXiv.1906.09694.
7. Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Minneapolis, Minnesota, 2019. – p. 4171-4186.– doi: 10.18653/v1/N19-1423.
8. Hoberg G., Phillips G. Product Market Synergies and Competition in Mergers and Acquisitions: A Text-Based Analysis // Review of Financial Studies. – 2010. – № 10. – p. 3773-3811. – doi: 10.1093/rfs/hhq053.
9. Hoberg G., Phillips G. Text-Based Network Industries and Endogenous Product Differentiation // Journal of Political Economy. – 2016. – № 5. – p. 1423-1465. – doi: 10.1086/688176.
10. Jagrič T., Herman A. AI Model for Industry Classification Based on Website Data // Information (Switzerland). – 2024. – № 2. – p. 89. – doi: 10.3390/info15020089.
11. Kim D., Kang H.G., Bae K., Jeon S. An artificial intelligence-enabled industry classification and its interpretation // Internet Research: Electronic Networking Applications and Policy. – 2022. – № 2. – p. 406-424. – doi: 10.1108/INTR-05-2020-0299.
12. McInnes L., Healy J., Melville J. UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction. ArXiv preprint. [Электронный ресурс]. URL: https://arxiv.org/abs/1802.03426.
13. Ortakci Ya., Borhan B. Optimizing SBERT for long text clustering: two novel approaches with empirical insights // The Journal of Supercomputing. – 2025. – № 8. – p. 950. – doi: 10.1007/s11227-025-07414-4.
14. Papenkov M., Meredith C., Noel C., Padalkar J., Hendrickson T., Nitiutomo D., Farrell T. Multi-Industry Simplex: A Probabilistic Extension of GICS. arXiv preprint. [Электронный ресурс]. URL: https://arxiv.org/abs/2310.04280.
15. Reimers N., Gurevych I. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing. Hong Kong, China, 2019. – p. 3982-3992.– doi: 10.18653/v1/D19-1410.
16. Vamvourellis D., Tóth M., Bhagat S., Desai D., Mehta D., Pasquali S. Company Similarity using Large Language Models. ArXiv preprint. [Электронный ресурс]. URL: https://arxiv.org/abs/2308.08031.
17. Financial statement data for publicly traded companies. Yahoo Finance. [Электронный ресурс]. URL: https://finance.yahoo.com/ (дата обращения: 16.05.2026).
18. Yang H., Lee H. J., Cho S., Cho E. Automatic Classification of Securities using Hierarchical Clustering of the 10-Ks // 2016 IEEE International Conference on Big Data (Big Data). Washington, DC, 2016. – p. 3936-3943.– doi: 10.1109/BigData.2016.7841069.

Страница обновлена: 12.08.2026 в 19:58:26

 

 

An alternative approach to the industry classification of public companies based on text clustering: an empirical study based on NASDAQ data

Vetrova M.A., Kuporov V.S., Gorkavtsev M.O.

Journal paper

Informatization in the Digital Economy
Volume 7, Number 2 (April-June 2026)

Citation:

Abstract:
Expert industry classifiers (GICS in international markets, the All-Russian Classifier of Economic Activities in the Russian Federation) underlie most empirical research in finance and economics, but they poorly reflect hybrid business models emerging as a result of digital transformation. The article aims to develop and test a reproducible inductive approach to grouping companies based on their textual self–descriptions, optimizing the ratio of clustering quality and computational efficiency. A methodological combination was applied to a sample of 3,380 public companies traded on the NASDAQ stock exchange: Sentence-BERT embeddings (all-MiniLM-L6-v2 model) without additional training, dimensionality reduction using the principal component method and clustering based on the k-means algorithm. The stability of the results was confirmed in three independent ways: by two alternative configurations (without dimensionality reduction and through density clustering UMAP+HDBSCAN), formal metrics of agreement with GICS (adjusted Rand index 0.46, average purity 61.4%) and the financial profile of clusters according to seven indicators that were not involved in the cluster construction. Six meaningfully interpreted groups were obtained: two clusters (clinical biotechnologies and commercial banks) reproduce the industry structure with a purity of 97-98%, the other two reveal structural phenomena that are indistinguishable in GICS (shell companies in mergers and acquisitions and a consumer hybrid combining retail with B2C platforms). The proposed methodology is highly reproducible. It does not require additional model training, and it is applicable to refine the industry structure based on data from Russian companies using the All-Russian Classifier of Economic Activities as a reference classification.

Keywords: industry classification, text clustering, Sentence-BERT, k-means method, GICS, digital transformation

JEL-classification: G14, C38, L25

References:

Bai H., Xing F. Z., Cambria E., Huang W.-B. (2019). Business Taxonomy Construction Using Concept-Level Hierarchical Clustering Proceedings of the First Workshop on Financial Technology and Natural Language Processing. 1-7. doi: 10.48550/arXiv.1906.09694.

Devlin J., Chang M.-W., Lee K., Toutanova K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. 4171-4186. doi: 10.18653/v1/N19-1423.

Fedorova E.A., Salnikova P.A. (2024). Impact of Environmental Initiative Disclosures on Share Prices of Russian Public Companies. Ekonomicheskiy zhurnal. 28 (2). 223-247. doi: 10.17323/1813-8691-2024-28-2-223-247.

Financial statement data for publicly traded companiesYahoo Finance. Retrieved May 16, 2026, from https://finance.yahoo.com/

Gorda A.S. (2025). Digital Transformation of Business Models of Enterprises in the Retail Sector. Omskiy nauchnyy vestnik. Seriya Obschestvo. Istoriya. Sovremennost. 10 (4). 120-126. doi: 10.25206/2542-0488-2025-10-4-120-126.

Hoberg G., Phillips G. (2010). Product Market Synergies and Competition in Mergers and Acquisitions: A Text-Based Analysis Review of Financial Studies. 23 (10). 3773-3811. doi: 10.1093/rfs/hhq053.

Hoberg G., Phillips G. (2016). Text-Based Network Industries and Endogenous Product Differentiation Journal of Political Economy. 124 (5). 1423-1465. doi: 10.1086/688176.

Jagrič T., Herman A. (2024). AI Model for Industry Classification Based on Website Data Information (Switzerland). 15 (2). 89. doi: 10.3390/info15020089.

Kim D., Kang H.G., Bae K., Jeon S. (2022). An artificial intelligence-enabled industry classification and its interpretation Internet Research: Electronic Networking Applications and Policy. 32 (2). 406-424. doi: 10.1108/INTR-05-2020-0299.

Kozyr N.S., Kovalenko V.S. (2017). Performance Metrics of Industrial Classification in the Russian Federation and Abroad. Ekonomicheskiy analiz: teoriya i praktika. 16 (10(469)). 1914-1927. doi: 10.24891/ea.16.10.1914.

Makeeva E.Yu., Arshavskiy I.V. (2014). Integration of Neural Networks and Semantic Interpretation for Bankruptcy Prediction. Korporativnye finansy. 8 (4(32)). 130-141. doi: 10.17323/j.jcfr.2073-0438.8.4.2014.130-141.

McInnes L., Healy J., Melville J. UMAP: Uniform Manifold Approximation and Projection for Dimension ReductionArXiv preprint. Retrieved from https://arxiv.org/abs/1802.03426

Mikhnenko P.A. (2022). Transformation of the Largest Russian Companies’ Business Vocabulary in Annual Reports: Data Mining. Upravlenets. 13 (5). 17-33. doi: 10.29141/2218-5003-2022-13-5-2.

Ortakci Ya., Borhan B. (2025). Optimizing SBERT for long text clustering: two novel approaches with empirical insights The Journal of Supercomputing. 81 (8). 950. doi: 10.1007/s11227-025-07414-4.

Papenkov M., Meredith C., Noel C., Padalkar J., Hendrickson T., Nitiutomo D., Farrell T. Multi-Industry Simplex: A Probabilistic Extension of GICSarXiv preprint.. Retrieved from https://arxiv.org/abs/2310.04280

Reimers N., Gurevych I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing. 3982-3992. doi: 10.18653/v1/D19-1410.

Vamvourellis D., Tóth M., Bhagat S., Desai D., Mehta D., Pasquali S. Company Similarity using Large Language ModelsArXiv preprint. Retrieved from https://arxiv.org/abs/2308.08031

Yang H., Lee H. J., Cho S., Cho E. (2016). Automatic Classification of Securities using Hierarchical Clustering of the 10-Ks 2016 IEEE International Conference on Big Data (Big Data). 3936-3943. doi: 10.1109/BigData.2016.7841069.