«Тағам инженериясы және биотехнология», «Химиялық технология», "Техникалық физика және Жылу энергетикасы" және «Автоматтандыру және ақпараттық технологиялар» бағыттары бойынша үшінші нөмірге жарияланымдар қабылдау жабылды!

Прием публикаций на третий номер по направлениям «Пищевая инженерия и биотехнология», «Химическая технология», «Техническая физика и теплоэнергетика» и «Автоматизация и информационные технологии» закрыт!

Submissions for the third issue in the fields of “Food Engineering and Biotechnology”, “Chemical Technology”, "Technical physics and thermal power engineering" and “Automation and Information Technologies” are closed!

Preview

Вестник Университета Шакарима. Серия технические науки

Расширенный поиск

ПОСТРОЕНИЕ И ЛИНГВИСТИЧЕСКИЙ АНАЛИЗ ВОПРОСНО-ОТВЕТНОГО КОРПУСА KAZAKH HISTORYQA

https://doi.org/10.53360/2788-7995-2026-1(21)-14

Аннотация

Цифровизация среднего образования в Казахстане усиливает потребность в специализированных казахскоязычных ресурсах, поддерживающих интеллектуальные вопросноответные системы по школьным предметам. Однако существующие QA-датасеты в основном ориентированы на высокоресурсные языки и не охватывают содержание учебных дисциплин, в частности истории Казахстана. В данной работе представлен и подробно проанализирован корпус Kazakh HistoryQA – первый специализированный вопросно-ответный ресурс на казахском языке, созданный на основе шести официальных учебников по истории Казахстана для 5-10 классов. Корпус включает 208 тематических секций, около 180 тысяч токенов и 661 QA-пару с привязкой к точным координатам ответного спана, что обеспечивает совместимость со стандартными пайплайнами обучения моделей машинного чтения, включая библиотеку HuggingFace.
Проведён многоуровневый анализ корпуса: статистика длины контекстов, вопросов и ответов, распределение материалов по классам и учебникам, типологизация вопросов на фактологические, хронологические, процедурные, причинно-следственные и сравнительные. Дополнительно выполнено морфологическое профилирование текста, построен частотный словарь и выделены предметные термины. Для оценки надежности корпуса как бенчмарка реализованы базовые модели выбора предложений (случайный выбор, TF-IDF, BM25), среди которых BM25 показал лучшие результаты. Представленный корпус создаёт основу для последующих исследований и разработки гибридных онтологически обогащённых QA-систем в сфере образования.

Об авторах

М. Ж. Ергеш
Евразийский национальный университет им. Л.Н. Гумилёва
Казахстан

Манас Жантуғанұлы Ергеш – докторант кафедры «Технологий искусственного интеллекта» 

010000, Астана, ул. Сатпаева, 2



Б. Ж. Ергеш
Евразийский национальный университет им. Л.Н. Гумилёва
Казахстан

Бану Жантуғанқызы Ергеш – PhD, заместитель директора департамента цифрового развития 

010000, Астана, ул. Сатпаева, 2



А. Р. Оразаева
АО «Казахский университет технологии и бизнеса им. К. Кулажанова»
Казахстан

Айнур Ришатовна Оразаева – PhD, ассистент-профессор кафедры «Информационные технологии» 

010000, Астана, ул. Мухамедханова, 37А



А. Талгат
АО «Казахский университет технологии и бизнеса им. К. Кулажанова»
Казахстан

Амангуль Талгат – сеньор-лектор кафедры «Информационные технологии» 

010000, Астана, ул. Мухамедханова, 37А



Список литературы

1. Vartiainen T. Engaging with bad (meta) data in historical corpus linguistics / T. Vartiainen, T. Säily // Challenges in Corpus Linguistics. – John Benjamins Publishing Company, 2024. – P. 9-34.

2. Durrell M. ‘Representativeness’, ‘Bad Data’, and legitimate expectations. What can an electronic historical corpus tell us that we didn’t actually know already (and how)? / M. Durrell // Historical Corpora. Challenges and Perspectives. – Narr, 2024. – P. 13-33.

3. Historical insights at scale: A corpus-wide machine learning analysis of early modern astronomic tables / O. Eberle et al // Science Advances. – 2024. – Vol. 10, № 43. – P. eadj1719.

4. Václav C. When Data Meet Tools: Using the Monitor Corpus for the Analysis of Language Development / C. Václav, S. Martin, P. Klára // Jazykovedný Časopis. – 2025. – Vol. 76, № 1. – P.

5. Gorozhanov A.I. Natural Language Processing and Fiction Text: Basis for Corpus Research / A.I. Gorozhanov, I.A. Guseinova, D.V. Stepanova // Vestnik Rossiiskogo universiteta druzhby narodov. Seriya: Teoriya yazyka. Semiotika. Semantika. – 2024. – Vol. 15, № 1. – P. 195-210.

6. TIGQA: An Expert Annotated Question Answering Dataset in Tigrinya / H. Teklehaymanot et al // arXiv preprint arXiv:2404. – 17194. – 2024.

7. Nyarko G.S. Leaderships' Role in Quality Assurance Moderating Curriculum Implementation: Perspectives and Preferences of Headteachers and Teachers in Basic Schools in Ghana / G.S. Nyarko // Education Quarterly Reviews. – 2025. – Vol. 8, № 3.

8. Veitsman Y. Recent advancements and challenges of Turkic Central Asian language processing / Y. Veitsman, M. Hartmann // Proceedings of the First Workshop on Language Models for Low-Resource Languages. – 2025. – P. 309-324.

9. Biyik H. Turkish Delights: A Dataset on Turkish Euphemisms / H. Biyik, P. Lee, A. Feldman // Proceedings of the First Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2024). – 2024. – P. 71-80.

10. Kardeş-NLU: Transfer to Low-Resource Languages with the Help of a High-Resource Cousin – A Benchmark and Evaluation for Turkic Languages / L.K. Senel et al // Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics. – 2024. – Vol. 1. – P. 1672-1688.

11. Tutar K. Turkish Question-Answer Dataset Evaluated with Deep Learning / K. Tutar, O.T. Yildiz // 2024 9th International Conference on Computer Science and Engineering (UBMK). – IEEE, 2024. – P. 101-105.

12. Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation / M.A. Bayram et al // arXiv preprint arXiv:2501.00593. – 2024.

13. Kaya Y.B. Effect of Tokenization Granularity for Turkish Large Language Models / Y.B. Kaya, A.C. Tantung // Intelligent Systems with Applications. – 2024. – Vol. 21. – Art. 200335.

14. Development and Evaluation of a Small Kazakh Language Corpus to Improve the Efficiency of Multilingual NLP Systems in Low-Resource Environments / A. Tleubayeva et al // 2025 IEEE 5th International Conference on Smart Information Systems and Technologies (SIST). – IEEE, 2025. – P. 1-6.

15. Aitim A. A Comparison of Kazakh Language Processing Models for Improving Semantic Search Results / A. Aitim, R. Satybaldiyeva // Eastern-European Journal of Enterprise Technologies. – 2025. – Vol. 133, № 2.

16. Machine Learning Methods for Kazakh Morphology: A Comprehensive Overview / I. Akhmetov et al // 2024 IEEE 3rd International Conference on Problems of Informatics, Electronics and Radio Engineering (PIERE). – IEEE, 2024. – P. 1880-1884.


Рецензия

Для цитирования:


Ергеш М.Ж., Ергеш Б.Ж., Оразаева А.Р., Талгат А. ПОСТРОЕНИЕ И ЛИНГВИСТИЧЕСКИЙ АНАЛИЗ ВОПРОСНО-ОТВЕТНОГО КОРПУСА KAZAKH HISTORYQA. Вестник Университета Шакарима. Серия технические науки. 2026;1(1(21)):126-135. https://doi.org/10.53360/2788-7995-2026-1(21)-14

For citation:


Yergesh M.Zh., Yergesh B.Zh., Orazayeva A., Talgat А. CONSTRUCTION AND LINGUISTIC ANALYSIS OF THE QUESTION-ANSWER CORPUS OF KAZAKH HISTORYQA. Bulletin of Shakarim University. Technical Sciences. 2026;1(1(21)):126-135. (In Russ.) https://doi.org/10.53360/2788-7995-2026-1(21)-14

Просмотров: 108

JATS XML


Creative Commons License
Контент доступен под лицензией Creative Commons Attribution 4.0 License.


ISSN 2788-7995 (Print)
ISSN 3006-0524 (Online)
X