ҚАЗАҚ ТАРИХЫ СҰРАҚ-ЖАУАП КОРПУСЫНЫҢ ҚҰРЫЛЫСЫ ЖӘНЕ ЛИНГВИСТИКАЛЫҚ ТАЛДАУЫ
https://doi.org/10.53360/2788-7995-2026-1(21)-14
Аңдатпа
Қазақстандағы орта білім беруді цифрландыру мектеп пәндері бойынша интеллектуалды сұрақ-жауап жүйелерін қолдайтын мамандандырылған қазақ тіліндегі ресурстарға деген қажеттілікті арттырып отыр. Дегенмен, қолданыстағы сапаны қамтамасыз ету деректер жиынтығы негізінен жоғары ресурсты тілдерге бағытталған және академиялық пәндердің, әсіресе Қазақстан тарихының мазмұнын қамтымайды. Бұл мақалада 5-10 сыныптарға арналған Қазақстан тарихы бойынша алты ресми оқулық негізінде жасалған қазақ тіліндегі алғашқы мамандандырылған сұрақ-жауап ресурсы – Kazakh HistoryQA корпусы ұсынылған және талданған. Корпусқа 208 тақырыптық бөлім, шамамен 180 000 токен және дәл жауап беру аралық координаталарына сілтеме жасалған 661 QA-жұбы кіреді, бұл HuggingFace кітапханасын қоса алғанда, стандартты машиналық оқу моделінің оқыту құбырларымен үйлесімділікті қамтамасыз етеді. Корпустың көп деңгейлі талдауы жүргізілді, оның ішінде контексттердің, сұрақтар мен жауаптардың ұзақтығы, материалдарды сыныптар мен оқулық бойынша бөлу және сұрақтарды фактілік, хронологиялық, процедуралық, себеп-салдарлық және салыстырмалы деп жіктеу статистикасы жасалды. Сонымен қатар, мәтіннің морфологиялық профилі жасалды, жиілік сөздігі жасалды және пәндік терминдер анықталды. Корпустың сенімділігін эталон ретінде бағалау үшін негізгі сөйлемдерді таңдау модельдері (кездейсоқ таңдау, TF-IDF, BM25) енгізілді, BM25 ең жақсы нәтижелерді көрсетті. Ұсынылған корпус білім берудегі гибридті, онтологиялық тұрғыдан байытылған QA-жүйелерін кейінгі зерттеулер мен әзірлеу үшін негіз болып табылады.
Авторлар туралы
М. Ж. ЕргешҚазақстан
Манас Жантуғанұлы Ергеш – Жасанды Интеллект Технологиялары кафедрасының докторанты
010000, Астана, ул. Сатпаева, 2
Б. Ж. Ергеш
Қазақстан
Бану Жантуғанқызы Ергеш – PhD, Л.Н. Гумилев атындағы Еуразия ұлттық университетінің Цифрлық даму департаменті директордың орынбасары
010000, Астана, ул. Сатпаева, 2
А. Р. Оразаева
Қазақстан
Айнур Ришатовна Оразаева – PhD, «Ақпараттық технологиялар» кафедрасы, ассистентпрофессор
010000, Астана, ул. Мухамедханова, 37А
А. Талғат
Қазақстан
Амангуль Талгат – сеньор-лектор, «Ақпараттық технологиялар» кафедрасы
010000, Астана, ул. Мухамедханова, 37А
Әдебиет тізімі
1. Vartiainen T. Engaging with bad (meta) data in historical corpus linguistics / T. Vartiainen, T. Säily // Challenges in Corpus Linguistics. – John Benjamins Publishing Company, 2024. – P. 9-34.
2. Durrell M. ‘Representativeness’, ‘Bad Data’, and legitimate expectations. What can an electronic historical corpus tell us that we didn’t actually know already (and how)? / M. Durrell // Historical Corpora. Challenges and Perspectives. – Narr, 2024. – P. 13-33.
3. Historical insights at scale: A corpus-wide machine learning analysis of early modern astronomic tables / O. Eberle et al // Science Advances. – 2024. – Vol. 10, № 43. – P. eadj1719.
4. Václav C. When Data Meet Tools: Using the Monitor Corpus for the Analysis of Language Development / C. Václav, S. Martin, P. Klára // Jazykovedný Časopis. – 2025. – Vol. 76, № 1. – P.
5. Gorozhanov A.I. Natural Language Processing and Fiction Text: Basis for Corpus Research / A.I. Gorozhanov, I.A. Guseinova, D.V. Stepanova // Vestnik Rossiiskogo universiteta druzhby narodov. Seriya: Teoriya yazyka. Semiotika. Semantika. – 2024. – Vol. 15, № 1. – P. 195-210.
6. TIGQA: An Expert Annotated Question Answering Dataset in Tigrinya / H. Teklehaymanot et al // arXiv preprint arXiv:2404. – 17194. – 2024.
7. Nyarko G.S. Leaderships' Role in Quality Assurance Moderating Curriculum Implementation: Perspectives and Preferences of Headteachers and Teachers in Basic Schools in Ghana / G.S. Nyarko // Education Quarterly Reviews. – 2025. – Vol. 8, № 3.
8. Veitsman Y. Recent advancements and challenges of Turkic Central Asian language processing / Y. Veitsman, M. Hartmann // Proceedings of the First Workshop on Language Models for Low-Resource Languages. – 2025. – P. 309-324.
9. Biyik H. Turkish Delights: A Dataset on Turkish Euphemisms / H. Biyik, P. Lee, A. Feldman // Proceedings of the First Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2024). – 2024. – P. 71-80.
10. Kardeş-NLU: Transfer to Low-Resource Languages with the Help of a High-Resource Cousin – A Benchmark and Evaluation for Turkic Languages / L.K. Senel et al // Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics. – 2024. – Vol. 1. – P. 1672-1688.
11. Tutar K. Turkish Question-Answer Dataset Evaluated with Deep Learning / K. Tutar, O.T. Yildiz // 2024 9th International Conference on Computer Science and Engineering (UBMK). – IEEE, 2024. – P. 101-105.
12. Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation / M.A. Bayram et al // arXiv preprint arXiv:2501.00593. – 2024.
13. Kaya Y.B. Effect of Tokenization Granularity for Turkish Large Language Models / Y.B. Kaya, A.C. Tantung // Intelligent Systems with Applications. – 2024. – Vol. 21. – Art. 200335.
14. Development and Evaluation of a Small Kazakh Language Corpus to Improve the Efficiency of Multilingual NLP Systems in Low-Resource Environments / A. Tleubayeva et al // 2025 IEEE 5th International Conference on Smart Information Systems and Technologies (SIST). – IEEE, 2025. – P. 1-6.
15. Aitim A. A Comparison of Kazakh Language Processing Models for Improving Semantic Search Results / A. Aitim, R. Satybaldiyeva // Eastern-European Journal of Enterprise Technologies. – 2025. – Vol. 133, № 2.
16. Machine Learning Methods for Kazakh Morphology: A Comprehensive Overview / I. Akhmetov et al // 2024 IEEE 3rd International Conference on Problems of Informatics, Electronics and Radio Engineering (PIERE). – IEEE, 2024. – P. 1880-1884.
Рецензия
Дәйектеу үшін:
Ергеш М.Ж., Ергеш Б.Ж., Оразаева А.Р., Талғат А. ҚАЗАҚ ТАРИХЫ СҰРАҚ-ЖАУАП КОРПУСЫНЫҢ ҚҰРЫЛЫСЫ ЖӘНЕ ЛИНГВИСТИКАЛЫҚ ТАЛДАУЫ. Шәкәрім Университетінің Хабаршысы. Техникалық ғылымдар сериясы. 2026;1(1(21)):126-135. https://doi.org/10.53360/2788-7995-2026-1(21)-14
For citation:
Yergesh M.Zh., Yergesh B.Zh., Orazayeva A., Talgat А. CONSTRUCTION AND LINGUISTIC ANALYSIS OF THE QUESTION-ANSWER CORPUS OF KAZAKH HISTORYQA. Bulletin of Shakarim University. Technical Sciences. 2026;1(1(21)):126-135. (In Russ.) https://doi.org/10.53360/2788-7995-2026-1(21)-14
JATS XML















