ПОСТРОЕНИЕ И ЛИНГВИСТИЧЕСКИЙ АНАЛИЗ ВОПРОСНО-ОТВЕТНОГО КОРПУСА KAZAKH HISTORYQA
https://doi.org/10.53360/2788-7995-2026-1(21)-14
Аннотация
Цифровизация среднего образования в Казахстане усиливает потребность в специализированных казахскоязычных ресурсах, поддерживающих интеллектуальные вопросноответные системы по школьным предметам. Однако существующие QA-датасеты в основном ориентированы на высокоресурсные языки и не охватывают содержание учебных дисциплин, в частности истории Казахстана. В данной работе представлен и подробно проанализирован корпус Kazakh HistoryQA – первый специализированный вопросно-ответный ресурс на казахском языке, созданный на основе шести официальных учебников по истории Казахстана для 5-10 классов. Корпус включает 208 тематических секций, около 180 тысяч токенов и 661 QA-пару с привязкой к точным координатам ответного спана, что обеспечивает совместимость со стандартными пайплайнами обучения моделей машинного чтения, включая библиотеку HuggingFace.
Проведён многоуровневый анализ корпуса: статистика длины контекстов, вопросов и ответов, распределение материалов по классам и учебникам, типологизация вопросов на фактологические, хронологические, процедурные, причинно-следственные и сравнительные. Дополнительно выполнено морфологическое профилирование текста, построен частотный словарь и выделены предметные термины. Для оценки надежности корпуса как бенчмарка реализованы базовые модели выбора предложений (случайный выбор, TF-IDF, BM25), среди которых BM25 показал лучшие результаты. Представленный корпус создаёт основу для последующих исследований и разработки гибридных онтологически обогащённых QA-систем в сфере образования.
Ключевые слова
Об авторах
М. Ж. ЕргешКазахстан
Манас Жантуғанұлы Ергеш – докторант кафедры «Технологий искусственного интеллекта»
010000, Астана, ул. Сатпаева, 2
Б. Ж. Ергеш
Казахстан
Бану Жантуғанқызы Ергеш – PhD, заместитель директора департамента цифрового развития
010000, Астана, ул. Сатпаева, 2
А. Р. Оразаева
Казахстан
Айнур Ришатовна Оразаева – PhD, ассистент-профессор кафедры «Информационные технологии»
010000, Астана, ул. Мухамедханова, 37А
А. Талгат
Казахстан
Амангуль Талгат – сеньор-лектор кафедры «Информационные технологии»
010000, Астана, ул. Мухамедханова, 37А
Список литературы
1. Vartiainen T. Engaging with bad (meta) data in historical corpus linguistics / T. Vartiainen, T. Säily // Challenges in Corpus Linguistics. – John Benjamins Publishing Company, 2024. – P. 9-34.
2. Durrell M. ‘Representativeness’, ‘Bad Data’, and legitimate expectations. What can an electronic historical corpus tell us that we didn’t actually know already (and how)? / M. Durrell // Historical Corpora. Challenges and Perspectives. – Narr, 2024. – P. 13-33.
3. Historical insights at scale: A corpus-wide machine learning analysis of early modern astronomic tables / O. Eberle et al // Science Advances. – 2024. – Vol. 10, № 43. – P. eadj1719.
4. Václav C. When Data Meet Tools: Using the Monitor Corpus for the Analysis of Language Development / C. Václav, S. Martin, P. Klára // Jazykovedný Časopis. – 2025. – Vol. 76, № 1. – P.
5. Gorozhanov A.I. Natural Language Processing and Fiction Text: Basis for Corpus Research / A.I. Gorozhanov, I.A. Guseinova, D.V. Stepanova // Vestnik Rossiiskogo universiteta druzhby narodov. Seriya: Teoriya yazyka. Semiotika. Semantika. – 2024. – Vol. 15, № 1. – P. 195-210.
6. TIGQA: An Expert Annotated Question Answering Dataset in Tigrinya / H. Teklehaymanot et al // arXiv preprint arXiv:2404. – 17194. – 2024.
7. Nyarko G.S. Leaderships' Role in Quality Assurance Moderating Curriculum Implementation: Perspectives and Preferences of Headteachers and Teachers in Basic Schools in Ghana / G.S. Nyarko // Education Quarterly Reviews. – 2025. – Vol. 8, № 3.
8. Veitsman Y. Recent advancements and challenges of Turkic Central Asian language processing / Y. Veitsman, M. Hartmann // Proceedings of the First Workshop on Language Models for Low-Resource Languages. – 2025. – P. 309-324.
9. Biyik H. Turkish Delights: A Dataset on Turkish Euphemisms / H. Biyik, P. Lee, A. Feldman // Proceedings of the First Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2024). – 2024. – P. 71-80.
10. Kardeş-NLU: Transfer to Low-Resource Languages with the Help of a High-Resource Cousin – A Benchmark and Evaluation for Turkic Languages / L.K. Senel et al // Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics. – 2024. – Vol. 1. – P. 1672-1688.
11. Tutar K. Turkish Question-Answer Dataset Evaluated with Deep Learning / K. Tutar, O.T. Yildiz // 2024 9th International Conference on Computer Science and Engineering (UBMK). – IEEE, 2024. – P. 101-105.
12. Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation / M.A. Bayram et al // arXiv preprint arXiv:2501.00593. – 2024.
13. Kaya Y.B. Effect of Tokenization Granularity for Turkish Large Language Models / Y.B. Kaya, A.C. Tantung // Intelligent Systems with Applications. – 2024. – Vol. 21. – Art. 200335.
14. Development and Evaluation of a Small Kazakh Language Corpus to Improve the Efficiency of Multilingual NLP Systems in Low-Resource Environments / A. Tleubayeva et al // 2025 IEEE 5th International Conference on Smart Information Systems and Technologies (SIST). – IEEE, 2025. – P. 1-6.
15. Aitim A. A Comparison of Kazakh Language Processing Models for Improving Semantic Search Results / A. Aitim, R. Satybaldiyeva // Eastern-European Journal of Enterprise Technologies. – 2025. – Vol. 133, № 2.
16. Machine Learning Methods for Kazakh Morphology: A Comprehensive Overview / I. Akhmetov et al // 2024 IEEE 3rd International Conference on Problems of Informatics, Electronics and Radio Engineering (PIERE). – IEEE, 2024. – P. 1880-1884.
Рецензия
Для цитирования:
Ергеш М.Ж., Ергеш Б.Ж., Оразаева А.Р., Талгат А. ПОСТРОЕНИЕ И ЛИНГВИСТИЧЕСКИЙ АНАЛИЗ ВОПРОСНО-ОТВЕТНОГО КОРПУСА KAZAKH HISTORYQA. Вестник Университета Шакарима. Серия технические науки. 2026;1(1(21)):126-135. https://doi.org/10.53360/2788-7995-2026-1(21)-14
For citation:
Yergesh M.Zh., Yergesh B.Zh., Orazayeva A., Talgat А. CONSTRUCTION AND LINGUISTIC ANALYSIS OF THE QUESTION-ANSWER CORPUS OF KAZAKH HISTORYQA. Bulletin of Shakarim University. Technical Sciences. 2026;1(1(21)):126-135. (In Russ.) https://doi.org/10.53360/2788-7995-2026-1(21)-14
JATS XML















