ФОРМАЛЬНЫЕ И НЕЙРОННЫЕ ПОДХОДЫ К МОРФОЛОГИЧЕСКОМУ АНАЛИЗУ В АГГЛЮТИНАТИВНЫХ ЯЗЫКАХ: ДАННЫЕ КАЗАХСКОГО ЯЗЫКА
https://doi.org/10.53360/2788-7995-2026-2(22)-14
Аннотация
Автоматический морфологический анализ традиционно представляет значительную сложность для агглютинативных языков вследствие их богатой словоизменительной системы, продуктивного словообразования и сложных морфофонологических правил. Современные нейронные модели, особенно архитектуры на основе трансформеров, демонстрируют высокие эмпирические показатели. Однако они нередко характеризуются недостаточной лингвистической прозрачностью и сталкиваются с трудностями систематического обобщения в условиях ограниченных ресурсов. В данной работе предлагается сравнительное и интегративное исследование формальных (правил-ориентированных и конечных автоматов) и нейронных подходов к морфологическому анализу на примере казахского языка как агглютинативного языка с низкими ресурсами. Вначале представляется формальная морфологическая модель, явно описывающая структуру «корень–аффикс», сингармонизм и морфотактические ограничения. Далее исследуются различные нейронные архитектуры для морфологической дизамбигуации и разметки, включая KazBERT в сочетании с декодированием на основе условных случайных полей (CRF). Помимо стандартных метрик точности проводится детальная типология ошибок и лингвистический анализ, в рамках которых изучается, как различные классы моделей справляются с неоднозначностью, редкими словоформами и длинными цепочками аффиксов. Результаты показывают, что, хотя нейронные модели превосходят исключительно правил-ориентированные системы по поверхностной точности, они демонстрируют устойчивые недостатки при обработке морфологически сложных и редких конструкций. Формальные модели, в свою очередь, обеспечивают более надёжное обобщение за счёт языковых ограничений. На основе полученных результатов предлагается гибридная морфологически осведомлённая архитектура, интегрирующая символические ограничения в нейронный вывод. Данный подход обеспечивает устойчивое улучшение результатов в различных условиях оценки. Работа демонстрирует, что эффективный морфологический анализ агглютинативных языков требует сочетания нейронного обучения представлений и явного лингвистического моделирования. Полученные выводы не ограничиваются одним языком и имеют более широкие последствия для морфологически чувствительного NLP в низкоресурсных условиях.
Об авторе
Ә. Қ. ӘйтімКазахстан
Әйгерім Әйтім – PhD, ассоциированный профессор кафедры «Информационные системы»,
050040, Алматы, ул.Манас, 34/1
Список литературы
1. Marquard C. Neural morphological tagging for Nguni languages. In Proceedings of the Sixth Workshop on African Natural Language Processing (AfricaNLP 2025) / C. Marquard, S. Mawere, F. Meyer // Association for Computational Linguistics. – 2025. – Р. 210-220. https://aclanthology.org/2025.africanlp-1.31.
2. Stenlund M. Surface-level morphological segmentation of low-resource Inuktitut using pre-trained large language models. In Proceedings of the Joint 25th Nordic Conference on Computational Linguistics and 11th Baltic Conference on Human Language Technologies (NoDaLiDa/Baltic-HLT 2025) / M. Stenlund, H. Myneni, M. Riedel // University of Tartu Library. – 2025. – Р. 688-696. https://aclanthology.org/2025.nodalida-1.69.
3. Research on morphological knowledge-guided low-resource agglutinative languages-Chinese translation / G. Abudouwaili et al // Complex & Intelligent Systems – 2025. https://doi.org/10.1007/s40747-025-01780-5.
4. Developing a hybrid morphological analyzer for low-resource languages / M. Supriya et al // Applied Sciences. – 2025. – № 15(10). – Р. 5682. https://doi.org/10.3390/app15105682.
5. Baitenova L. Hybrid artificial intelligence architectures for automatic text analysis and computational morphology / L. Baitenova // Frontiers in Artificial Intelligence. – 2025. – № 8. – Р. 1708566. https://doi.org/10.3389/frai.2025.1708566.
6. Yazar B.K. Improving low-resource Kazakh-English and Turkish-English neural machine translation using transfer learning and part-of-speech tags / B.K. Yazar, E. Kiliç, // IEEE Access. – 2025. – № 13. – Р. 32341-32356. https://doi.org/10.1109/ACCESS.2025.3542491.
7. Belth C. Meaning-informed low-resource segmentation of agglutinative morphology. In Proceedings of SCiL 2024. ACL Anthology.
8. Aitim A. Developing methods for automatic processing systems of Kazakh language / A. Aitim // KazATC Bulletin. – 2024. – № 133(4). – Р. 254-265. https://doi.org/10.52167/1609-1817-2024-133-4-254-265.
9. Aitim A. Building a high-quality annotated corpus for Kazakh NLP: a pipeline approach / A. Aitim // Vestnik KazUTB. – 2025. – vol. 4, № 29. https://doi.org/10.58805/kazutb.v.4.29-1092.
10. QNLP – Full Kazakh NLP Suite GitHub repository. Retrieved from https://github.com/Aigerimhub/qnlp.
11. A. Aitim QazNLP: Constraint-Aware Multi-Task Sequence Labeling for Morphologically Rich Low-Resource Languages / A. Aitim // in IEEE Access. – 2026. – vol. 14. – Р. 70955-70974. https://doi.org/10.1109/ACCESS.2026.3691193.
12. Aitim A. LLM-Assisted Weak Supervision for Low-Resource Kazakh Sequence Labeling: Synthetic Annotation and CRF-Refined NER/POS Models / A. Aitim // Applied Sciences. – 2026. – № 16(8). – Р. 3632. https://doi.org/10.3390/app16083632.
Рецензия
Для цитирования:
Әйтім Ә.Қ. ФОРМАЛЬНЫЕ И НЕЙРОННЫЕ ПОДХОДЫ К МОРФОЛОГИЧЕСКОМУ АНАЛИЗУ В АГГЛЮТИНАТИВНЫХ ЯЗЫКАХ: ДАННЫЕ КАЗАХСКОГО ЯЗЫКА. Вестник Университета Шакарима. Серия технические науки. 2026;(2(22)):132-141. https://doi.org/10.53360/2788-7995-2026-2(22)-14
For citation:
Aitim A.K. FORMAL AND NEURAL APPROACHES TO MORPHOLOGICAL ANALYSIS IN AGGLUTINATIVE LANGUAGES: EVIDENCE FROM KAZAKH. Bulletin of Shakarim University. Technical Sciences. 2026;(2(22)):132-141. https://doi.org/10.53360/2788-7995-2026-2(22)-14
JATS XML















