Гетерогенность оценочных стратегий как проблема разметки датасета для целей эмоционального анализа текстов на русском языке

Kolmogorova, Anastasia
Siberian Federal University, Russian Federation
akolmogorova@sfu-kras.ru

Kalinin, Alexander
Siberian Federal University, Russian Federation
verbalab@yandex.ru

В настоящее время специфика развития области машинного обучения в целом может быть описана таким термином как “общедоступность” (commodity). Для широкого спектра задач уже имеются алгоритмы машинного обучения, реализованные на разных языках программирования, есть готовые размеченные датасеты, а также предобученные модели (Daily et al. 2017). Все эти артефакты, как правило, доступны под открытой лицензией, что делает их использование повсеместным. В связи с этим остро встает проблема решения задач, для которых отсутствуют доступные средства их решения, в особенности — качественные датасеты. Отсюда же вытекает проблема методики и инструментария их получения.

Задачей выполняемого нашей исследовательской группой проекта (грант РФФИ) является разработка многоклассового компьютерного классификатора (а в перспективе и регрессора, предсказывающего числовые значения для эмоций (Önal / Ertuğrul 2014)) для русскоязычных интернет-текстов по критерию выражаемой в них эмоции. Изучив существующие типологии (Bruna et al. 2016), в качестве основы мы взяли восьмичленную классификацию эмоций шведского нейрофизиолога Г. Лёвхейма (Lövheim 2012): грусть, радость, отвращение, удивление, воодушевление, гнев, стыд, страх. Девятый класс – нейтральный. Таким образом, проект лежит в области эмоционального анализа текста (Bhowmick et al. 2009), стремящегося, в отличие от сентимент-анализа, указать присутствующие в текстовом фрагменте классы эмоций.

Эмпирическая и технологическая база проекта предполагает наличие датасета (коллекции текстов, для каждого текста в которой эмоциональный класс уже известен). Особо отметим, что русскоязычные датасеты интернет-текстов в целом оказались пока ресурсом труднодоступным, а размеченных в соответствии с выделенными нами 9 классами – вообще нет. Как следствие, нам понадобилось получить этот датасет самим. Для этой цели была разработана процедура недискретной эмоциональной разметки (Kalinin et al. 2018), в рамках которой асессорам предлагалось прочитать небольшой текст (80 ‒100 слов) и поставить отметку в любой точке шкалы от -5 до 5. Точка “0” считалась точкой нейтральной тональности. Для каждого текста предлагалось 4 шкалы со следующими полюсами: Стыд – Воодушевление, Отвращение – Гнев, Удовольствие – Грусть, Страх – Удивление. Выбор именно таких полюсов шкал неслучаен: они формируют пары противоположных эмоций, согласно концепции Г. Лёвхейма, и образуют внутренние диагонали предложенной им модели Куба. Каждое из 4-х измерений трактовалось как вектор со своим углом в трехмерном пространстве и своей магнитудой. Эти 4 вектора затем агрегировались в один результирующий вектор путем усреднения. С помощью конечной точки результирующего вектора мы определяли “эмоциональные” координаты текста в пространстве Куба.

Апробация такого интерфейса для недискретной эмоциональной оценки текстовых данных на русском языке проходила в несколько этапов.

Сначала мы провели такую разметку, пригласив посредством объявления в социальной сети “ВКонтакте” 234 волонтера, средний возраст которых составил 21 год. Разметка проводилась онлайн. Перед тем как перейти к разметке, асессоры заполняли опросник (Mehrabian / Epstein 1972) для определения индивидуального уровня эмпатии. Когда все ответы от всех информантов были получены, выяснилось, что радикальность оценки, т. е. то, насколько далеко от нулевой отметки предпочитали ставить метку информанты, находилась в отношениях прямой корреляции с уровнем эмпатии: чем выше уровень индивидуальной эмпатии, тем радикальнее в целом оценка всех текстов данным информантом. Тем не менее в нашей выборке таких высокоэмпатичных информантов оказалось не более 5 %, поэтому мы решили в дальнейшем просто убирать значения-аутлайнеры в данных, не проводя дополнительную преселекцию информантов по признаку уровня эмпатии.

В следующей пробе участвовали 2000 асессоров, зарегистрированных на одной из краудсорсинговых платформ и имеющих рейтинг выше среднего, которым для оценки было предложено 3920 эмоциональных текстовых фрагментов из пабликов “Подслушано”, “Карамель” и “Палата № 6” (по 490 текстов из 8 эмоциональных классов).

В последней пробе, в целом, результаты были достаточно согласованными (коэффициент конкордации ‒ 0.65), однако и здесь удалось обнаружить влияние, по-видимому, индивидуальных когнитивных стратегий оценивания. Проанализировав ответы всех информантов, мы выделили 4 группы, для каждой из которых ведущей была одна из четырех следующих стратегий: 1) информант выделяет доминирующую эмоцию с максимальной позицией на одной шкале, а на остальных шкалах отмечает слабо выраженное присутствие других эмоций; 2) информант в большинстве случаев склонен выделять одну главную эмоцию, давая ей максимальные оценки, вторую – лишь слегка уступающую ей по выраженности, на остальных же ‒ слабая выраженность каких-либо эмоций; 3) на всех шкалах информант склонен ставить радикальные оценки; 4) информант дает очень сдержанные, близкие по диапазону оценки на каждой из шкал.

В результате, мы как исследователи были удивлены оценками, данными информантами ряду текстов. Например, следующий текст ‒ “Мое прошлое такое позорное, я его очень стыжусь. Если кто-то интересуется, всегда вру одно и то же. Настолько завралась, что кажется, сама поверила. Никто про меня не знает настоящей правды, даже самые близкие друзья и родственники” ‒ попал, согласно полученным оценкам, в когорту “самых радостных текстов”.

Таким образом, опыт показал, что на эмоциональную разметку текстовых данных могут влиять следующие факторы: индивидуальный уровень эмпатии информанта; его привычные когнитивные стратегии оценки эмоции, которые, возможно, обусловлены уровнем сформированности его эмоционального интеллекта. Все это оказывает влияние на качество датасета, делая его менее “детерминированным”, подверженным искажению и влиянию неконтролируемых переменных.

Что касается возможного снижения роли данных факторов, то здесь следует, с одной стороны, отметить роль обучения асессоров, которое часто применяется в работах по эмоциональной оценке (см., например (Alm et al. 2005)), но, с другой стороны, это имеет смысл, когда речь идет об ограниченном количестве информантов (5-7), поскольку 2000 информантов обучить практически невозможно, тем более в рамках краудсорсинга, где добавляются требования контроля качества и добросовестности оценки.

Подводя итог, отметим, что несмотря на проблематику исследования, связанного непосредственно с компьютерными технологиями, именно человеческий фактор создает зашумление для чрезвычайно важного для машинного обучения этапа подготовки обучающего множества. Проблемный вопрос остается открытым и, на наш взгляд, требует своего обсуждения в экспертном сообществе.

Материалы подготовлены по результатам научного проекта, поддержанного РФФИ, проект № 19-012-00205 Разработка классификатора русскоязычных интернет-текстов по критерию их тональности на основе модели эмоций “Куб Левхейма”.

Appendix A

Литература
  1. Alm, Cecilia Ovesdotter / Rot, Dan / Sproat, Richard (2005): “Emotions from text: machine learning for text-based emotion prediction”, in: Mooney, Raymond / Brew, Chris / Chien, Lee-Feng / Kirchhoff, Katrin (eds.): Proceedings of Human Language Technology Conference and Conference on Empirical Methods in Natural Language Processing, Vancouver, British Columbia, Canada, October 2005 579–586.
  2. Bhowmick, Plaban Kumar / Basu, Anupam / Mitra, Pabitra (2009): “Reader perspective emotion analysis, in text through ensemble based multi-label classification framework”, in: Computer and Information Science 2, 4: 64–74 DOI: 10.5539/cis.v2n4p64.
  3. Bruna, Ondřej / Avetisyan, Hakob / Holub, Jan (2016): “Emotion models for textual emotion classification”, in: Journal of Physics: Conference Series 772 DOI: 10.1088/1742-6596/772/1/012063 <https://iopscience.iop.org/article/10.1088/1742-6596/772/1/012063/pdf> [07.06.21].
  4. Daily, Shaundra Bryant / James, Melva T. / Cherry, David / Porter III, John J. / Darnell, Shelby Solomon / Isaac, Joseph / Roy, Tania (2017): “Affective computing: historical foundations, current applications, and future trends”, in: Jeon, Myounghoon (ed.): Emotions and Affect in Human Factors and Human-Computer Interaction. London: Academic Press 213–231 DOI: 10.1016/B978-0-12-801851-4.00009-4.
  5. Kalinin, Alexander / Kolmogorova, Anastasia / Nikolaeva, Galina / Malikova, Alina (2018): “Mapping texts to multidimensional emotional space: challenges for dataset acquisition in sentiment analysis”, in: Alexandrov, Daniel A. / Boukhanovsky, Alexander V. / Chugunov, Andrei V. / Kabanov, Yury / Koltsova, Olessia (eds.): Digital Transformation and Global Society. DTGS 2018. Communications in Computer and Information Science 859, St. Peterburg, Russia, May-June 2018 361–367 DOI: 10.1007/978-3-030-02846-6_29.
  6. Lövheim, Hugo (2012): “A new three-dimensional model for emotions and monoamine neuro-transmitters”, in: Medical Hypotheses 78: 341–348 DOI: 10.1016/j.mehy.2011.11.016.
  7. Mehrabian, Albert / Epstein, Norman (1972): “A measure of emotional empathy”, in: Journal of Personality 40, 4: 525–543 DOI: 10.1111/j.1467-6494.1972.tb00078.x.
  8. Önal, Itir / Ertuğrul, Ali Mert (2014): “Effect of using regression in sentiment analysis”, in: 22nd Signal Processing and Communications Applications Conference (SIU), Trabzon, Turkey, 23-25 April 2014 1822–1825 DOI: 10.1109/SIU.2014.6830606.