<?xml version="1.0" encoding="UTF-8"?>
<TEI xmlns="http://www.tei-c.org/ns/1.0">
    <teiHeader>
        <fileDesc>
            <titleStmt>
                <title>Томский диалектный корпус и перспективы корпусной диалектологии</title>
                <author>
                    <persName>
                        <surname>Galanina</surname>
                        <forename>Valeria Viktorovna</forename>
                    </persName>
                    <affiliation>National Research Tomsk State University, Russian Federation</affiliation>
                    <email>gogolgget@gmail.com</email>
                </author>
                <author>
                    <persName>
                        <surname>Zemicheva</surname>
                        <forename>Svetlana Sergeevna</forename>
                    </persName>
                    <affiliation>National Research Tomsk State University, Russian Federation</affiliation>
                    <email>optysmith@gmail.com</email>
                </author>
            </titleStmt>
            <editionStmt>
                <edition>
                    <date>2021-09-20T10:55:00Z</date>
                </edition>
            </editionStmt>
            <publicationStmt>
                <publisher>Elisabeth Burr, University of Leipzig</publisher>
                <address>
                    <addrLine>Beethovenstr. 15</addrLine>
                    <addrLine>04107 Leipzig</addrLine>
                    <addrLine>Germany</addrLine>
                    <addrLine>Elisabeth Burr</addrLine>
                </address>
            </publicationStmt>
            <sourceDesc>
                <p>Converted from a Word document</p>
            </sourceDesc>
        </fileDesc>
        <encodingDesc>
            <appInfo>
                <application ident="DHCONVALIDATOR" version="1.22">
                    <label>DHConvalidator</label>
                </application>
            </appInfo>
        </encodingDesc>
        <profileDesc>
            <textClass>
                <keywords scheme="ConfTool" n="category">
                    <term>Paper</term>
                </keywords>
                <keywords scheme="ConfTool" n="subcategory">
                    <term>Short Paper</term>
                </keywords>
                <keywords scheme="ConfTool" n="keywords">
                    <term>корпусная лингвистика</term>
                    <term>Томский диалектный корпус</term>
                    <term>диалектология</term>
                </keywords>
                <keywords scheme="ConfTool" n="topics">
                    <term>Conversion</term>
                    <term>Transcription</term>
                    <term>Designing</term>
                    <term>Programming</term>
                    <term>Annotating</term>
                    <term>Modeling</term>
                    <term>Preservation</term>
                    <term>Meta: Teaching/Learning</term>
                    <term>DigitalHumanities</term>
                    <term>Projects</term>
                    <term>Text</term>
                    <term>Tools</term>
                    <term>Language</term>
                    <term>Research</term>
                    <term>not applicable</term>
                    <term>not applicable</term>
                    <term>Russian</term>
                </keywords>
            </textClass>
        </profileDesc>
    </teiHeader>
    <text>
        <body>
            <p>Тезисы подготовлены за счёт гранта Российского научного фонда (проект № 19-78-10015).</p>
            <p>Компьютерная лингвистика и корпусный подход как её часть относятся к числу наиболее динамично развивающихся и востребованных областей в современной науке о языке, интегрируясь с другими её направлениями. В сфере диалектологии подобные методы также применяются всё чаще: на материале русского и других языков создаются электронные словари, фонотеки, лингвистические атласы, базы данных диалектной речи. Создание новых источников позволяет лингвистам быстрее и эффективнее собирать материал для проводимых ими исследований. Кроме того, электронные диалектологические ресурсы отражают речь сельских жителей, включающую воспоминания, описания обрядов, фольклор, и могут быть интересны не только лингвистам, но и представителям других гуманитарных наук – историкам, краеведам, антропологам, этнографам, социологам, а также широкому кругу читателей, что определяет общественную значимость подобных проектов.</p>
            <p>При этом создание таких ресурсов идёт медленно в связи с тем, что диалект – устная форма существования языка, поэтому первый этап создания корпуса – сбор материала и его расшифровка – является очень трудоёмким. Кроме того, собственно корпусные ресурсы технически более сложны по сравнению с другими типами электронных диалектологических источников (такими как словарь, библиотека текстов) и встречаются реже. Среди зарубежных диалектных корпусов можно упомянуть диалектный подкорпус в банке данных разговорного немецкого языка, чешский диалектный корпус, диалектный корпус болгарского языка, португальский синтаксически размеченный диалектный корпус, скандинавский диалектный корпус, включающий материалы нескольких языков – норвежского, шведского, датского, фарерского, исландского. В России, несмотря на огромную территорию страны и наличие диалектологических архивов во многих регионах, диалектные корпуса малочисленны и имеют небольшой объём. Диалектный подкорпус в составе Национального корпуса русского языка характеризуется многоуровневой разметкой: экстралингвистической, фонетической, морфологической, тематической, жанровой; центральное положение занимает морфологическая разметка со специальным маркированием диалектных особенностей. Однако корпус имеет недостаточный объём (395 440 слов) и, несмотря на представленность разных типов говоров (севернорусских, среднерусских, южнорусских) не может считаться репрезентативным для страны в целом (включает материалы 22 регионов), что актуализирует потребность в региональных корпусах. Среди таких ресурсов в настоящее время представлены корпус бассейна реки Устья с материалами из Архангельской области, насчитывающий более миллиона словоупотреблений, корпус говора села Малинино Липецкой области (166 639 словоупотреблений), корпус села Роговатка Белгородской области (114 600 словоупотреблений); диалектный корпус лингвокультуры Северного Приангарья (170 813 словоупотреблений), Кубанский диалектный корпус (без сведений об объёме) и др.</p>
            <p>Место Томского диалектного корпуса (далее ТДК) среди других российских корпусов определяется не только региональной спецификой его материала, но и репрезентативностью, а также наличием разнообразных видов разметки. Материалом для корпуса стали записи диалектной речи, сделанные в диалектологических экспедициях по среднему течению реки Оби (Томская и Кемеровская области) с 1946 года до настоящего времени. Имеющийся диалектный архив состоит из нескольких частей. Самые старые записи выполнены вручную, часть тетрадей представляет собой рукописные расшифровки аудиозаписей, наконец, имеется аудиоархив записей из новых экспедиций (2008–2019 гг.). В ходе реализации проекта рукописи и аудиофайлы переводятся в формат редактора Word. Материалы подаются в орфографической записи с отражением отдельных фонетических особенностей по специально разработанному стандарту. При этом доля материалов последнего десятилетия составляет 40%. Основная часть записей отражает речь носителей сибирских старожильческих говоров, в меньше степени (15% всех текстов) представлена речь новосёлов.</p>
            <p>Репрезентативность ТДК определяется долговременностью наблюдения (более 70 лет), охватом значительной территории (обследовано более 400 населённых пунктов региона), а также его объёмом: 2 546 текстов, более 2 500 000 словоупотреблений. Однако, если оценивать репрезентативность корпуса не только количественно, но и качественно, необходимо отметить, что записанные тексты по большей части являются полуаутентичными (представляют собой ответы на вопросы собирателей), но включают также элементы спонтанной речи, что типично для большинства диалектных архивов. Корпус находится в ограниченном доступе. Демонстрационная версия (102 текста) представлена на сайте 
                <ref target="http://losl.tsu.ru/corpus">
                    http://losl.tsu.ru/corpus
                </ref>.
            </p>
            <p>В корпусе реализовано несколько видов разметки. В рамках тематической разметки выделено 77 тем, представляющих «зоны актуального внимания сельского жителя» (Гольдин 2002: 60). Важно подчеркнуть детализированный характер данного вида разметки: тематическая метка присваивается не тексту в целом, а отдельному его фрагменту. На сегодняшний день общее число размеченных фрагментов – более 20 000.</p>
            <p>Разметка по типам текста нацелена на разграничение письменных и устных текстов, а среди последних – текстов, близких к естественной коммуникации (диалог диалектоносителей между собой, полилог, реплика, ситуативное вкрапление, пересказ разговора) и спровоцированных (лингвистический опрос). Материалы, исходно существовавшие в письменной форме, представлены в имеющемся архиве небольшим числом текстов, относящихся к типам «деловые бумаги» и «школьные тетради». В корпусе реализована также жанровая разметка. Маркируются жанры фольклора – песня, частушка, примета и т.п., а также речевые жанры – текстовые фрагменты, объединённые той или иной целевой установкой (информативные, оценочные, императивные, этикетные). Все виды текстовой разметки (тематическая, по типам текста, жанровая) осуществляются вручную с помощью html-тегов.</p>
            <p>В корпус внедрена автоматизированная грамматическая разметка на основе морфологического анализатора phpMorphy. PhpMorphy позволяет по заданному слову восстановить его основную и все остальные формы. Если слово присутствует во внутреннем словаре phpMorphy, то оно имеет статус найденного. Если в словаре слово не найдено, то phpMorphy пытается угадать, что за слово перед ним и в какой оно форме. Если последнее удаётся, то слово имеет статус угаданного. Парадигмы не угаданных и не найденных диалектных единиц вводятся вручную. Эффективность работы анализатора около 70 %. </p>
            <p>Ещё одним важным элементом архитектуры корпуса является лексикографический. В систему внедрены толкования диалектных лексем на основе опубликованных словарей. </p>
            <p>В ТДК представлены следующие типы поиска:</p>
            <list type="ordered">
                <item>По слову: поиск символьного соответствия, точной формы слова, леммы (совокупности словоформ).</item>
                <item>По грамматическим параметрам: часть речи, грамматические категории (род, число, падеж, время, лицо).</item>
                <item>По экстралингвистическим параметрам записи: год, место (область, район, населённый пункт), номер архивной тетради.</item>
                <item>По информанту (социолингвистическим параметрам): пол, год рождения, возраст, уровень образования, тип говора.</item>
                <item>По текстовым параметрам: тема, тип текста, жанр.</item>
                <item>По словарным пометам: уменьшительно-ласкательное, увеличительное, усилительное, снисходительное, смягчительное и др.</item>
            </list>
            <p>Разные виды поиска могут комбинироваться между собой. Предусмотрено изменение типа сортировки результатов: алфавитный порядок, сортировка по году записи (по возрастанию/по убыванию), сортировка по времени добавления в корпус (по возрастанию/по убыванию).</p>
        </body>
        <back>
            <div type="bibliogr">
                <listBibl>
                    <head>Библиография</head>
                    <bibl>
                        <hi rend="bold">Гольдин, Валентин Е.</hi> (2002): “Доминанты традиционной сельской культуры речевого общения”, в: Пшеничнова, Надежда Н. (отв. ред.): 
                        <hi rend="italic">Аванесовский сборник.</hi> Москва: Наука 58-64.
                    </bibl>
                </listBibl>
            </div>
        </back>
    </text>
</TEI>
