<?xml version="1.0" encoding="UTF-8"?>
<TEI xmlns="http://www.tei-c.org/ns/1.0">
    <teiHeader>
        <fileDesc>
            <titleStmt>
                <title>Использование веб-сервисов количественной и статистической оценки данных славянского исторического корпуса «Манускрипт» для лингвотекстологического анализа</title>
                <author>
                    <persName>
                        <surname>Baranov</surname>
                        <forename>Victor</forename>
                    </persName>
                    <affiliation>Kalashnikov Izhevsk State Technical University, Russian Federation</affiliation>
                    <email>victor.a.baranov@istu.ru</email>
                </author>
            </titleStmt>
            <editionStmt>
                <edition>
                    <date>2022-02-15T20:08:00Z</date>
                </edition>
            </editionStmt>
            <publicationStmt>
                <publisher>Elisabeth Burr, University of Leipzig</publisher>
                <address>
                    <addrLine>Beethovenstr. 15</addrLine>
                    <addrLine>04107 Leipzig</addrLine>
                    <addrLine>Germany</addrLine>
                    <addrLine>Elisabeth Burr</addrLine>
                </address>
            </publicationStmt>
            <sourceDesc>
                <p>Converted from a Word document</p>
            </sourceDesc>
        </fileDesc>
        <encodingDesc>
            <appInfo>
                <application ident="DHCONVALIDATOR" version="1.22">
                    <label>DHConvalidator</label>
                </application>
            </appInfo>
        </encodingDesc>
        <profileDesc>
            <textClass>
                <keywords scheme="ConfTool" n="category">
                    <term>Paper</term>
                </keywords>
                <keywords scheme="ConfTool" n="subcategory">
                    <term>Long paper</term>
                </keywords>
                <keywords scheme="ConfTool" n="keywords">
                    <term>славянские средневековые тексты</term>
                    <term>исторический корпус</term>
                    <term>корпусный менеджер</term>
                    <term>лингвистическая статистика</term>
                    <term>служебная минея на май</term>
                </keywords>
                <keywords scheme="ConfTool" n="topics">
                    <term>Transcription</term>
                    <term>Programming</term>
                    <term>Content Analysis</term>
                    <term>Contextualizing</term>
                    <term>Preservation</term>
                    <term>Sharing</term>
                    <term>Tools</term>
                    <term>Software</term>
                    <term>Methods</term>
                    <term>Manuscript</term>
                    <term>ResearchProcess</term>
                    <term>ResearchResults</term>
                    <term>not applicable</term>
                    <term>not applicable</term>
                    <term>Russian</term>
                </keywords>
            </textClass>
        </profileDesc>
    </teiHeader>
    <text>
        <body>
            <div type="div1" rend="DH-Heading1">
                <head>Общая характеристика корпуса “Манускрипт”</head>
                <p>Исторический корпус “Манускрипт: славянское письменное наследие” (manuscripts.ru) содержит машиночитаемые транскрипции более 140 полных кодексов и дошедших до настоящего времени отрывков средневековых письменных памятников X–XV веков общим объемом около 3,5 млн текстовых форм.</p>
                <p>Технологической платформой корпуса является полнотекстовая база данных, модель которой предусматривает хранение любых структурных единиц рукописей, текстов, словарей, их характеристик и связей между ними. </p>
                <p>Пользовательский интерфейс включает запросные веб-формы и интерфейсы визуализации выборок, которые, наряду со стандартными для корпусов параметрами запросов и режимами демонстрации (формирование подкорпуса, поиск по маске, поиск словосочетаний, вывод конкорданса и др.), имеют и нестандартные, позволяющие сформировать подкорпуса на основе аналитической разметки, вывести на экран любую часть рукописи по диапазону листов, просмотреть указатели лингвистических единиц или в максимально приближенной к оригиналу форме, или с максимальной ее унификацией, построить сопоставительные перечни нескольких кодексов и др. (Баранов 2015; Baranov 2018; Баранов 2019а).</p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Статистические модули корпуса</head>
                <p>Известно, что количественные и статистические методы давно и очень успешно используются для решения большого количества прикладных и теоретических задач, в том числе в области лингвистики, филологии и истории (см., например, (Морозов 1915; Марусенко 1990; Милов и др. 1994; Шайкевич и др. 2013; Захаров / Хохлова 2014; Митрофанова 2015; Литвинова и др. 2016; Mimno / Blei 2011; Bing 2012; Blei 2012; Daud 2012; Guest et al. 2012; Jurafsky / Martin 2020: 325–415) и многие другие работы, посвященные общим и частным вопросам на стыке статистики и гуманитарных наук).</p>
                <p>Наличие достаточно большой коллекции структурированных и размеченных текстов позволило поставить вопрос о разработке программ, процедур и веб-интерфейсов поиска и демонстрации сведений о количественных и статистических характеристиках лингвистических единиц. Такими специализированными модулями корпуса в настоящее время являются модуль статистики и модуль n-грамм. Первый позволяет увидеть распределение слов внутри рукописей, сопоставить количественные характеристики единиц текстов, оценить их с помощью статистических мер в сопоставлении с контрольным подкорпусом. Второй – построить перечни n-грамм отдельной рукописи или подкорпуса на основе статистических, формально-структурных и/или лингвистических параметров (Баранов 2016; Baranov / Gnutikov 2019). </p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Приемы сопоставительного статистического анализа канонов, стихир и седальнов славянской майской минеи</head>
                <p>В докладе будут представлены результаты количественного и статистического анализа четырех славянских списков XI–XIII веков служебной минеи на май (РНБ, Соф. 202; РНБ, Соф. 203; РНБ, Соф. 204; ГИМ, Син. 166). Внимание будет уделено трем этапам работы: а) приемам построения подкорпусов на основе разметки больших и малых чтений (канонов, стихир и седальнов), б) предоставляемым статистическими модулями способам и параметрам извлечения и сопоставления данных, в) использованию подготовленных выборок в специализированных статистических пакетах. Кроме того, будут даны примеры лингвотекстологической интерпретации результатов количественной и статистической оценки текстов компилятивного состава, текстовые и языковые особенности которых должны исследоваться с учетом их состава и структуры. </p>
                <p>Необходимость такого подхода диктуется сложной историей формирования структуры и состава служебных (повседневных) миней в греческой и славянской традициях (Нечунаева 2000; Кривко 2008; Йовчева 2014; Кривко 2016; Пентковский 2018), наличием нескольких историко-типологических групп миней, по терминологии Р. Н. Кривко (Кривко 2016: 15–16), отдельным существованием больших и малых чтений в составе особых книг как в палестинской гимнографической традиции (Кривко 2008: 90–92; Кривко 2016: 13), так и в славянской (Пентковский 2018: 258–259, 267), наличием в древнейших минеях разных редакций (переводов) одних и тех же последовательностей (Кривко 2016) и отдельных их жанров, например стихир (Пентковский 2018: 252, 267–269), которые могли делатьсяя в том числе и на основе различных исходных греческих текстов (Пентковский 2018: 267, 271) и др. Анализ текстологических, лексических, словообразовательных, морфологических разночтений позволяет систематизировать сохранившиеся списки, установить их преемственность, сделать выводы о характере влияния древнейших переводов и редакций на более поздние и т. д. (см., например, (Нечунаева 2000; Кривко 2015) и мн. др. работы). </p>
                <p>Методика анализа разночтений предполагает сопоставление или отдельных лексем, словообразовательных или морфологических форм, или ряда разночтений разного типа в относительно небольшом по объему, содержащем один и тот же текст фрагменте нескольких списков. </p>
                <p>Наличие полнотекстового размеченного корпуса средневековых славянских миней и компьютерного инструментария работы с ними позволяет поставить задачу выявления имеющихся в рукописях значимых лингвистических различий, которые могут быть обнаружены в результате количественного и статистического анализа тех или иных текстовых форм в полном объеме в ходе а) сопоставления рукописей друг с другом, б) сопоставления текстов разных жанров друг другу в пределах одного списка, в) сопоставления текстов одного жанра в разных рукописях с текстами другого жанра в тех же списках. Решение первой задачи представлено в работах (Баранов 2018; Баранов 2019б; Баранов 2019в), методика решения второй и третьей задач будет представлена в данном докладе.</p>
                <p>
                    <hi rend="italic">Формирование подкорпусов</hi>. Аналитическая разметка на основе характеристик фрагментов миней позволяет сформировать подкорпуса канонов, стихир и седальнов как одной рукописи, так и нескольких, с помощью специализированных модулей извлечь из них ключевые слова или би- и триграммы и с помощью сопоставления их состава сделать выводы о лексико-тематических и лексико-семантических характеристиках. 
                </p>
                <p>
                    <hi rend="italic">Ключевые слова</hi>. Извлечение статистически значимых (ключевых) слов осуществляется в модуле статистики с помощью статистических мер Log-Likelihood, TF*ICTF, Weirdness (об этих мерах см., например, (Kwok 1995; Ahmad at al. 1999; Rayson / Garside 2000: 3; Roelleke / Wang 2006; Wu et al. 2008: 17; Ляшевская / Шаров 2011: 8–9; Клышинский / Кочеткова 2014: 368)) на основе сравнения частотности лингвистических единиц в анализируемых подкорпусах с их частотностью в контрольном подкорпусе, в качестве которого может быть выбран, например, подкорпус, включающий или только минеи, или все тексты исторического корпуса. 
                </p>
                <p>
                    <hi rend="italic">Статистически значимые сочетания</hi>. Модуль n-грамм
                    обеспечивает извлечение из подкорпусов таких сочетаний текстовых форм (или
                    лемм), которые претендуют на статус устойчивых. Помимо оценки дистрибуции с
                    помощью статистических мер (Mutual Information и ее варианты, T-score,
                    Log-Likelihood, Dice, Chi-squared, Log Ratio, Minimum Sensitivity, Inside,
                    C-value) (об этих мерах см., например, (Evert 2010; Mima et al. 1998;
                    Браславский / Соколов 2006; Ягунова / Пивоварова 2013; Кочеткова 2013)), модуль
                    статистики предоставляет пользователям возможность указать расстояние между
                    компонентами, учесть границы конструкций, разделенных пунктуационными знаками,
                    порядок следования компонентов – закрепленный или свободный и другие
                    характеристики сочетаний. </p>
                <p>
                    <hi rend="italic">Унификация маски</hi>. При подготовке запросов пользователь может устранить графическую вариативность слов и форм и получить сведения не о их текстовых вариантах, а о собственно лингвистических единицах – словоформах и леммах. Вариативность снимается унификацией диакритики и титл и/или их устранением, заменой вариантных букв на основные, выполнением запроса на основе лемм, транслитерацией.
                </p>
                <p>Эксперименты с текстовыми формами, леммами и их сочетаниями, извлеченными из подкорпусов канонов, стихир и седальнов, позволяют установить тематическую специфику малых и больших чтений.</p>
                <p>
                    <hi rend="italic">Корреляционный и кластерный анализ</hi>. Извлеченные из подкорпусов соответствующие друг другу по характеристикам перечни могут быть проанализированы в специализированных статистических пакетах. В работе использован пакет Statistica (TIBCO Software Inc.), с помощью которого на основе ранговой статистики Спирмена исследуется степень корреляции подкорпусов друг другу (о методе см., например, (Фёрстер / Рёнц 1983: 160–163)) и анализируется степень их статистической близости с помощью кластерного анализа (см., например, (Tryon 1939; Cattell 1944; Sokal / Sneath 1963; Мандель 1988; Прикладная статистика 1989; Gore 2000; Маннинг и др. 2011: 383–396)). 
                </p>
                <p>С целью нивелирования влияния на результаты анализа тематики сопоставляемых подкорпусов в качестве материала выбраны служебные слова (предлоги, союзы, частицы), характеризующиеся тематической нейтральностью. Корреляция для каждой пары подкорпусов вычисляется на основе сведений о месте (рангах) соответствующих друг другу служебных слов в сортированных по их частотности перечнях. Набор значений попарных корреляций каждого из подкорпусов принимается за индивидуальную характеристику подкорпуса и используется на следующем этапе – при одномерном кластерном анализе. </p>
                <p>Для подтверждения объективности результатов применяются различные сочетания приемов формирования кластеров (одиночной связи, полной связи, метода Варда и др.) и вычисления близости (Евклидово расстояние, Манхэттенское расстояние и др.). Эксперименты позволяют установить степень близости подкорпусов канонов, подкорпусов стихир и подкорпусов седальнов нескольких текстов друг другу.</p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Заключение</head>
                <p>Эффективность и результативность использования больших хранилищ машиночитаемых размеченных средневековых текстов для лингвистического анализа во многом зависит от наличия специализированных инструментов доступа к данным и режимов демонстрации выборок. При этом специфические особенности точных транскрипций требуют соответствующих инструментов обработки, унификации, нормализации, разметки, извлечения и визуализации данных. В свою очередь специализированный инструментарий позволяет лингвисту-историку использовать новые приемы систематизации и сравнения данных, работать с полным массивом лингвистических единиц, ставить и решать задачи количественной и статистической оценки текстовых и языковых единиц сопоставляемых массивов (подкорпусов) данных.</p>
                <p>Результативность такого взаимовлияния средневекового текстового материала, инструментария и статистических методик демонстрируется в докладе.</p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Благодарности</head>
                <p>Работа выполняется при поддержке Российского фонда фундаментальных исследований (РФФИ) в рамках проекта “Лингвостатистический анализ однокомпонентных и многокомпонентных лексических единиц исторического корпуса “Манускрипт”” (грант № 18-012-00463).</p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Электронные интернет-ресурсы</head>
                <p>Модуль статистики корпуса “Манускрипт” &lt;http://manuscripts.ru/mns/!cred2.stat&gt;</p>
                <p>Модуль n-грамм корпуса “Манускрипт” &lt;http://manuscripts.ru/mns/cred_ngr.stat&gt;</p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Источники</head>
                <p>Служебная минея на май (Путятина Минея), XI в. (РНБ, Соф. 202), 135 л. &lt;http://manuscripts.ru/mns/main?p_text=16723192&gt;</p>
                <p>Служебная минея на май, XII в. (РНБ, Соф. 203), 136 л. http://manuscripts.ru/mns/main?p_text=27457098.</p>
                <p>Служебная минея на май, XII в. (ГИМ, Син. 166), 176 л. &lt;http://manuscripts.ru/mns/main?p_text=26361893&gt;</p>
                <p>Служебная минея на май, XIII в. (РНБ, Соф. 204), 133 л. &lt;http://manuscripts.ru/mns/main?p_text=26513641&gt;</p>
            </div>
            <div type="div1" rend="DH-Heading1">
                <head>Сокращения</head>
                <p>ГИМ – Государственный исторический музей, г. Москва</p>
                <p>РНБ – Российская национальная библиотека, г. Санкт-Петербург</p>
                <p>РФФИ – Российский фонд фундаментальных исследований</p>
                <p>Син. – Синодальное собрание рукописей Государственного исторического музея</p>
                <p>Соф. – Софийское собрание рукописей Российской национальной библиотеки</p>
            </div>
        </body>
        <back>
            <div type="bibliogr">
                <listBibl>
                    <head>Библиография</head>
                    <bibl>
                        <hi rend="bold">Айвазян, Сергей А.</hi> / <hi rend="bold">Бухштабер, Виктор
                            М.</hi> / <hi rend="bold">Енюков, Игорь С.</hi> / <hi rend="bold"
                            >Мешалкин, Лев Д.</hi> (eds.) (1989): <hi rend="italic">Прикладная
                            статистика: классификация и снижение размерности</hi>. Москва: Финансы и
                        статистика. </bibl>
                    <bibl>
                        <hi rend="bold">Ahmad, Khurshid</hi> / <hi rend="bold">Gillam, Lee</hi> /
                            <hi rend="bold">Tostevin, Lena</hi> (1999): “Weirdness indexing for
                        logical document extrapolation and retrieval (WILDER)”, in: <hi
                            rend="italic">Proc. 8th Text Retrieval Conference TREC</hi>,
                        Gaithersburg, USA 717‒724. </bibl>
                    <bibl>
                        <hi rend="bold">Баранов, Виктор А.</hi> (2015): “Исторический корпус как
                        цель и инструмент корпусной палеославистики”, in: <hi rend="italic">Scripta
                            &amp; e-Scripta</hi> 14–15: 39–62. </bibl>
                    <bibl>
                        <hi rend="bold">Баранов, Виктор А.</hi> (2016): “Модуль n-грамм
                        исторического корпуса 'Манускрипт': структурные и лингвистические
                        параметры”, in: Галиуллин, Камиль Р. / Горобец, Елена А. / Николаев,
                        Геннадий А. (eds.): <hi rend="italic">Научное наследие В. А. Богородицкого и
                            современный вектор исследований Казанской </hi>лингвистической школы 1.
                        Казань: Издательство Казанского университета 50–61. </bibl>
                    <bibl>
                        <hi rend="bold">Баранов, Виктор А.</hi> (2018): “Количественный и
                        статистический анализ средневековых текстов: ключевые слова славянских
                        служебных миней XI–XIV вв.”, in: Пермский государственный национальный
                        исследовательский университет (ed.): <hi rend="italic">Естественнонаучные
                            методы в цифровой гуманитарной среде</hi>. Пермь: Пермский
                        государственный национальный исследовательский университет 73–77. </bibl>
                    <bibl>
                        <hi rend="bold">Baranov, Victor A.</hi> (2018): “Text Corpus of Medieval
                        Manuscripts as a Goal and a Tool for Linguistic Research”, in: Sels, Lara /
                        Fuchsbauer, Jürgen / Tomelleri, Vittorio / Vos, Ilse de (eds.): <hi
                            rend="italic">Editing Mediaeval Texts from a Different Angle: Slavonic
                            and Multilingual Traditions</hi>. To Honour Francis J. Thomson. Paris,
                        Bristol, Ct.: Peeters Leuven 283–308. </bibl>
                    <bibl>
                        <hi rend="bold">Баранов, Виктор А.</hi> (2019a): “Создание и использование
                        исторических корпусов славянских письменных памятников”, in: <hi
                            rend="italic">Scripta &amp; e-Scripta</hi> 19: 33–57. </bibl>
                    <bibl>
                        <hi rend="bold">Баранов, Виктор А.</hi> (2019b): “Опыт применения
                        количественных и статистических методов для поиска значимых слов в
                        историческом корпусе (на материале средневековых славянских гимнографических
                        и евангельских кодексов)”, in: Rothe, Hans / Schnell, Claudia (eds.): <hi
                            rend="italic">Studia Hymnographica </hi>II (= Patristica Slavica 24 /
                        Abhandlungen der Nordrhein-Westfälischen Akademie der Wissenschaften und der
                        Künste 131). Paderborn: Ferdinand Schöningh 149–201. </bibl>
                    <bibl>
                        <hi rend="bold">Баранов, Виктор А.</hi> (2019c): “Статистически значимые
                        слова четырех славянских служебных миней XI века”, in: <hi rend="italic"
                            >Slavistica Vilnensis</hi> 64, 2: 10–30. </bibl>
                    <bibl>
                        <hi rend="bold">Baranov, Victor A. </hi>/ <hi rend="bold">Gnutikov, Roman
                            M.</hi> (2019): “The statistics and n-gram modules of the historical
                        corpus “Manuscript”, in: Miltenova, Anisava / Baranov, Victor / Miklas,
                        Heinz / Hawkins, Kevin / Fuchsbauer, Jürgen (eds.): <hi rend="italic"
                            >Digital and Analytical Approaches to the Written Heritage</hi>. Textual
                        Heritage and Information Technologies 2018. Sofia: Gutenberg Publishing
                        House 9–28. </bibl>
                    <bibl>
                        <hi rend="bold">Bing, Liu</hi> (2012): <hi rend="italic">Sentiment Analysis
                            and Opinion Mining</hi>. Williston / London: Morgan &amp; Claypool
                        Publishers. </bibl>
                    <bibl>
                        <hi rend="bold">Blei, David</hi> (2012): “Probabilistic topic models”, in:
                            <hi rend="italic">Communications of the ACM</hi> 55, 4: 77–84. </bibl>
                    <bibl>
                        <hi rend="bold">Браславский, Павел</hi> / <hi rend="bold">Соколов,
                            Евгений</hi> (2006): “Сравнение четырех методов автоматического
                        извлечения двухсловных терминов из текста”, in: <hi rend="italic">Труды
                            международной конференции “Диалог 2006”</hi> 88–94 &lt;<ref
                            target="http://www.dialog-21.ru/media/1935/braslavskiy.pdf"
                            >http://www.dialog-21.ru/media/1935/braslavskiy.pdf</ref>&gt;
                        [14.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Cattell, Raymond B.</hi> (1944): “A note on correlation
                        clusters and cluster search methods”, in: <hi rend="italic"
                            >Psychometrica</hi> 9: 169–184. </bibl>
                    <bibl>
                        <hi rend="bold">Daud, Ali</hi> (2012): “Using Time Topic Modeling for
                        Semantics-Based Dynamic Research Interest Finding”, in: <hi rend="italic"
                            >Knowledge-Based Systems</hi> 26: 154–163. </bibl>
                    <bibl>
                        <hi rend="bold">Evert, Stefan</hi> (2010): “Association Measures”, in:
                        Evert, Stefan: <hi rend="italic">Computational Approaches to
                            Collocations</hi> &lt;<ref target="http://collocations.de/AM/index.html"
                            >http://collocations.de/AM/index.html</ref>&gt; [12.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Gore, Paul A. Jr.</hi> (2000): “Cluster analysis”, in:
                        Tinsley, Howard E. A. / Brown, Steven D. (eds.) <hi rend="italic">Handbook
                            of Applied Multivariate Statistics and Mathematical Modeling</hi>. San
                        Diego, CA: Academic Press 297–321. </bibl>
                    <bibl>
                        <hi rend="bold">Guest, Greg </hi>/ <hi rend="bold">MacQueen, Kathleen</hi> /
                            <hi rend="bold">Namey, Emily E.</hi> (2012): <hi rend="italic">Applied
                            thematic analysis</hi>. Thousand Oaks, California: Sage. </bibl>
                    <bibl>
                        <hi rend="bold">Jurafsky, Dan</hi> / <hi rend="bold">Martin, James H.</hi>
                        (2020): <hi rend="italic">Speech and natural language processing: An
                            introduction to natural language processing, computational linguistics,
                            and speech recognition</hi> &lt;<ref
                            target="https://web.stanford.edu/~jurafsky/slp3/ed3book.pdf"
                            >https://web.stanford.edu/~jurafsky/slp3/ed3book.pdf</ref>&gt;
                        [12.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Захаров, Виктор П.</hi> / <hi rend="bold">Хохлова, Мария
                            В.</hi> (2014): “Автоматическое выявление терминологических
                        словосочетаний”, in: <hi rend="italic">Структурная и прикладная
                            лингвистика</hi> 10: 182–200. </bibl>
                    <bibl>
                        <hi rend="bold">Йовчева, Мария</hi> (2014): <hi rend="italic"
                            >Старобългарският служебен миней</hi>. София: Издателски център «Боян
                        Пенев», Институт за литература при БАН. </bibl>
                    <bibl>
                        <hi rend="bold">Клышинский, Эдуард С.</hi> / <hi rend="bold">Кочеткова,
                            Наталия А.</hi> (2014): “Метод извлечения технических терминов с
                        использованием меры странности”, in: <hi rend="italic">Новые информационные
                            технологии в автоматизированных системах</hi> 17: 365‒370 &lt;<ref
                            target="https://elibrary.ru/download/elibrary_21527004_14693581.pdf"
                            >https://elibrary.ru/download/elibrary_21527004_14693581.pdf</ref>&gt;
                        [08.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Кочеткова, Наталия А. (2013)</hi>: “Статистические языковые
                        методы. Коллокации и коллигации”, in: <hi rend="italic">Новые информационные
                            технологии в автоматизированных системах</hi> 16: 301‒305 &lt;<ref
                            target="http://cyberleninka.ru/article/n/statisticheskie-yazykovye-metody-kollokatsii-i-kolligatsii"
                            >http://cyberleninka.ru/article/n/statisticheskie-yazykovye-metody-kollokatsii-i-kolligatsii</ref>&gt;
                        [12.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Кривко, Роман Н.</hi> (2008): “Синайско-славянские
                        гимнографические параллели”, in: <hi rend="italic">Вестник ПСТГУ</hi> III:
                            <hi rend="italic">Филология</hi> 1, 11: 56–102. </bibl>
                    <bibl>
                        <hi rend="bold">Кривко, Роман Н.</hi> (2015): <hi rend="italic">Очерки языка
                            древних церковнославянских рукописей</hi>. Москва: Индрик. </bibl>
                    <bibl>
                        <hi rend="bold">Кривко, Роман Н.</hi> (2016): <hi rend="italic">Текстология
                            и язык славянских служебных миней XI–XIV вв</hi>. Ph.D. thesis, Институт
                        славяноведения РАН. </bibl>
                    <bibl>
                        <hi rend="bold">Kwok, Kui-Lam</hi> (1995): “A network approach to
                        probabilistic information retrieval”, in: <hi rend="italic">ACM Transactions
                            on Information Systems</hi> 13, 3: 325–354. </bibl>
                    <bibl>
                        <hi rend="bold">Литвинова, Татьяна А.</hi> / <hi rend="bold">Загоровская,
                            Ольга В.</hi> / <hi rend="bold">Середин, Павел В.</hi> (2016):
                        “Диагностирование пола автора письменного текста на основе количественных
                        параметров: когнитивный подход”, in: <hi rend="italic">Вопросы когнитивной
                            лингвистики</hi> 4, 49: 51–59. </bibl>
                    <bibl>
                        <hi rend="bold">Ляшевская, Ольга Н.</hi> / <hi rend="bold">Шаров, Сергей
                            А.</hi> (2011): <hi rend="italic">Новый частотный словарь русской
                            лексики</hi>. Москва &lt;<ref target="http://dict.ruslang.ru/freq.php?"
                            >http://dict.ruslang.ru/freq.php?</ref>&gt; [08.02.2019]. </bibl>
                    <bibl>
                        <hi rend="bold">Мандель, Игорь Д.</hi> (1988): <hi rend="italic">Кластерный
                            анализ</hi>. Москва: Финансы и статистика. </bibl>
                    <bibl>
                        <hi rend="bold">Маннинг, Кристофер Д.</hi> / <hi rend="bold">Рагхаван,
                            Прабхакар</hi> / <hi rend="bold">Шютце, Хайнрих</hi> (2011): <hi
                            rend="italic">Введение в информационный поиск</hi>. Москва: ООО “И.Д.
                        Вильямс”. </bibl>
                    <bibl>
                        <hi rend="bold">Марусенко, Михаил А.</hi> (1990): <hi rend="italic"
                            >Атрибуция анонимных и псевдонимных литературных произведений методами
                            распознавания образов</hi>. Ленинград: Издательство Ленинградского
                        университета. </bibl>
                    <bibl>
                        <hi rend="bold">Mima, Hideki</hi> / <hi rend="bold">Frantzi, Katerina
                            T.</hi> / <hi rend="bold">Ananiadou, Sophia</hi> (1998): “The C-value /
                        Example-based Approach to the Automatic Recognition of Multi-Word Terms for
                        Cross-Language Terminology”, in: <hi rend="italic">The Pacific Rim
                            International Conferences on Artificial Intelligence (PRICAI'98)</hi>,
                        Singapore &lt;<ref
                            target="https://www.researchgate.net/publication/304254311"
                            >https://www.researchgate.net/publication/304254311</ref>&gt;
                        [22.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Mimno, David</hi> / <hi rend="bold">Blei, David M.</hi>
                        (2011): “Bayesian Checking for Topic Models”, in: John McIntyre Conference
                        Centre (ed.): <hi rend="italic">Conference on Empirical Methods in Natural
                            Language Processing (EMNLP)</hi>, Edinburgh, UK 227–237. </bibl>
                    <bibl>
                        <hi rend="bold">Милов, Леонид В.</hi> / <hi rend="bold">Бородкин, Леонид
                            И.</hi> / <hi rend="bold">Иванова, Татьяна В. и др.</hi> (eds.) (1994):
                            <hi rend="italic">От Нестора до Фонвизина: новые методы определения
                            авторства</hi>. Москва: Прогресс. </bibl>
                    <bibl>
                        <hi rend="bold">Митрофанова, Ольга А.</hi> (2015): “Тематическое
                        моделирование корпуса 'Народных русских сказок А. Н. Афанасьева'”, in: Герд,
                        Александр С. / Николаев Илья С. (eds.): <hi rend="italic">Структурная и
                            прикладная лингвистика</hi> 11: 146–154. </bibl>
                    <bibl>
                        <hi rend="bold">Морозов, Николай А.</hi> (1915): “Лингвистические спектры:
                        Средство для отличия плагиатов от истинных произведений того или другого
                        известного автора: Стилеметрический этюд”, in: <hi rend="italic">Известия
                            Отделения рус. языка и словесности Императорской Академии наук</hi> 20,
                        4: 93–134. </bibl>
                    <bibl>
                        <hi rend="bold">Нечунаева, Наталья А.</hi> (2000): <hi rend="italic">Минея
                            как тип славяно-греческого средневекового текста</hi>. Таллинн:
                        Издательство Таллиннского университета. </bibl>
                    <bibl>
                        <hi rend="bold">Пентковский, Алексей М.</hi> (2018): “Материалы для истории
                        славянского богослужения в XI веке: I. Восточно- и южнославянские служебные
                        Минеи”, in: <hi rend="italic">Лингвистическое источниковедение и история
                            русского языка. 2016–2017</hi>. Труды Института русского языка им. В. В.
                        Виноградова 16: 245–295. </bibl>
                    <bibl>
                        <hi rend="bold">Rayson, Paul</hi> / <hi rend="bold">Garside, Rodger</hi>
                        (2000): “Comparing corpora using frequency profiling”, in: <hi rend="italic"
                            >Proceedings of the Comparing Corpora Workshop at ACL 2000</hi>, Hong
                        Kong 1–6 &lt;<ref
                            target="http://ucrel.lancs.ac.uk/people/paul/publications/rg_acl2000.pdf"
                            >http://ucrel.lancs.ac.uk/people/paul/publications/rg_acl2000.pdf</ref>&gt;
                        [08.02.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Roelleke, Thomas </hi>/ <hi rend="bold">Wang, Jun</hi>
                        (2006): “A parallel derivation of probabilistic information retrieval
                        models”, in: Association for Computing Machinery (ed.): <hi rend="italic"
                            >SIGIR '06: Proceedings of the 29th annual international ACM SIGIR
                            conference on Research and development in information retrieval</hi>.
                        Seattle, WA, August 2006: 107–114 DOI: 10.1145/1148170.1148192. </bibl>
                    <bibl>
                        <hi rend="bold">Sokal, Robert R.</hi> / <hi rend="bold">Sneath, Peter H.
                            A.</hi> (1963): <hi rend="italic">Principles of Numerical Taxonomy</hi>.
                        San Francisco / London: W. H. Freeman and Co. </bibl>
                    <bibl>
                        <hi rend="bold">Tryon, Robert Ch.</hi> (1939): <hi rend="italic">Cluster
                            analysis: correlation profile and orthometric (factor) analysis for the
                            isolation of unities in mind and personality</hi>. Ann Arbor, Mich.:
                        Edwards brothers, inc. &lt;<ref
                            target="https://catalog.hathitrust.org/Record/001306510"
                            >https://catalog.hathitrust.org/Record/001306510</ref>&gt; [22.01.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Фёрстер, Эрхард</hi> / <hi rend="bold">Рёнц, Бернд</hi>
                        (1983): <hi rend="italic">Методы корреляционного и регрессионного
                            анализа</hi>. Руководство для экономистов. Москва: Финансы и статистика. </bibl>
                    <bibl>
                        <hi rend="bold">Шайкевич, Анатолий Я.</hi> / <hi rend="bold">Андрющенко,
                            Владислав М.</hi> / <hi rend="bold">Ребецкая, Наталья А.</hi> (2013):
                            <hi rend="italic">Дистрибутивно-статистический анализ языка русской
                            прозы 1850–1870-х гг.</hi> 1. Москва: Языки славянской культуры. </bibl>
                    <bibl>
                        <hi rend="bold">Ягунова, Елена В.</hi> / <hi rend="bold">Пивоварова, Лидия
                            М.</hi> (2013): “От коллокаций к конструкциям”, in: Сай, Сергей С.
                        (ed.): <hi rend="italic">Русский язык: конструкционные и
                            лексико-семантические подходы</hi>. Санкт-Петербург: Институт
                        лингвистических исследований &lt;<ref target="https://goo.gl/tIHeoR"
                            >https://goo.gl/tIHeoR</ref>&gt; [12.03.2020]. </bibl>
                    <bibl>
                        <hi rend="bold">Wu, Ho Chung</hi> / <hi rend="bold">Luk, Robert Wing
                            Pong</hi> / <hi rend="bold">Wong, Kam Fai</hi> / <hi rend="bold">Kwok,
                            Kui Lam</hi> (2008): “Interpreting TF-IDF Term Weights as Making
                        Relevance Decisions”, in: <hi rend="italic">ACM Transactions on Information
                            Systems</hi> 26, 3 &lt;<ref
                            target="https://www.scss.tcd.ie/khurshid.ahmad/Research/Sentiments/tfidf_relevance.pdf"
                            >https://www.scss.tcd.ie/khurshid.ahmad/Research/Sentiments/tfidf_relevance.pdf</ref>&gt;
                        [08.02.2020] DOI: 10.1145/1361684.1361686. </bibl>
                </listBibl>
            </div>
        </back>
    </text>
</TEI>
