"Тамақ инженериясы және биотехнология" және "Автоматтандыру және ақпараттық технологиялар" бағыттары бойынша үшінші нөмірге жарияланымдарды қабылдау жабық!

Прием публикаций на третий номер по направлениям «Пищевая инженерия и биотехнология» и «Автоматизация и информационные технологии» закрыт!

The reception of publications for the third issue in the areas of "Food Engineering and Biotechnology" and "Automation and Information Technology" is closed!

Preview

Шәкәрім Университетінің Хабаршысы. Техникалық ғылымдар сериясы

Кеңейтілген іздеу

ҚАЗАҚ ТАРИХЫ СҰРАҚ-ЖАУАП КОРПУСЫНЫҢ ҚҰРЫЛЫСЫ ЖӘНЕ ЛИНГВИСТИКАЛЫҚ ТАЛДАУЫ

https://doi.org/10.53360/2788-7995-2026-1(21)-14

Толық мәтін:

Аңдатпа

Қазақстандағы орта білім беруді цифрландыру мектеп пәндері бойынша интеллектуалды сұрақ-жауап жүйелерін қолдайтын мамандандырылған қазақ тіліндегі ресурстарға деген қажеттілікті арттырып отыр. Дегенмен, қолданыстағы сапаны қамтамасыз ету деректер жиынтығы негізінен жоғары ресурсты тілдерге бағытталған және академиялық пәндердің, әсіресе Қазақстан тарихының мазмұнын қамтымайды. Бұл мақалада 5-10 сыныптарға арналған Қазақстан тарихы бойынша алты ресми оқулық негізінде жасалған қазақ тіліндегі алғашқы мамандандырылған сұрақ-жауап ресурсы – Kazakh HistoryQA корпусы ұсынылған және талданған. Корпусқа 208 тақырыптық бөлім, шамамен 180 000 токен және дәл жауап беру аралық координаталарына сілтеме жасалған 661 QA-жұбы кіреді, бұл HuggingFace кітапханасын қоса алғанда, стандартты машиналық оқу моделінің оқыту құбырларымен үйлесімділікті қамтамасыз етеді. Корпустың көп деңгейлі талдауы жүргізілді, оның ішінде контексттердің, сұрақтар мен жауаптардың ұзақтығы, материалдарды сыныптар мен оқулық бойынша бөлу және сұрақтарды фактілік, хронологиялық, процедуралық, себеп-салдарлық және салыстырмалы деп жіктеу статистикасы жасалды. Сонымен қатар, мәтіннің морфологиялық профилі жасалды, жиілік сөздігі жасалды және пәндік терминдер анықталды. Корпустың сенімділігін эталон ретінде бағалау үшін негізгі сөйлемдерді таңдау модельдері (кездейсоқ таңдау, TF-IDF, BM25) енгізілді, BM25 ең жақсы нәтижелерді көрсетті. Ұсынылған корпус білім берудегі гибридті, онтологиялық тұрғыдан байытылған QA-жүйелерін кейінгі зерттеулер мен әзірлеу үшін негіз болып табылады.

Авторлар туралы

М. Ж. Ергеш
Л.Н. Гумилев атындағы Еуразия ұлттық университеті
Қазақстан

Манас Жантуғанұлы Ергеш – Жасанды Интеллект Технологиялары кафедрасының докторанты 

010000, Астана, ул. Сатпаева, 2



Б. Ж. Ергеш
Л.Н. Гумилев атындағы Еуразия ұлттық университеті
Қазақстан

Бану Жантуғанқызы Ергеш – PhD, Л.Н. Гумилев атындағы Еуразия ұлттық университетінің Цифрлық даму департаменті директордың орынбасары 

010000, Астана, ул. Сатпаева, 2



А. Р. Оразаева
Қ. Құлажанов атындағы Қазақ технология және бизнес университеті
Қазақстан

Айнур Ришатовна Оразаева – PhD, «Ақпараттық технологиялар» кафедрасы, ассистентпрофессор 

010000, Астана, ул. Мухамедханова, 37А



А. Талғат
Қ. Құлажанов атындағы Қазақ технология және бизнес университеті
Қазақстан

Амангуль Талгат – сеньор-лектор, «Ақпараттық технологиялар» кафедрасы 

010000, Астана, ул. Мухамедханова, 37А



Әдебиет тізімі

1. Vartiainen T. Engaging with bad (meta) data in historical corpus linguistics / T. Vartiainen, T. Säily // Challenges in Corpus Linguistics. – John Benjamins Publishing Company, 2024. – P. 9-34.

2. Durrell M. ‘Representativeness’, ‘Bad Data’, and legitimate expectations. What can an electronic historical corpus tell us that we didn’t actually know already (and how)? / M. Durrell // Historical Corpora. Challenges and Perspectives. – Narr, 2024. – P. 13-33.

3. Historical insights at scale: A corpus-wide machine learning analysis of early modern astronomic tables / O. Eberle et al // Science Advances. – 2024. – Vol. 10, № 43. – P. eadj1719.

4. Václav C. When Data Meet Tools: Using the Monitor Corpus for the Analysis of Language Development / C. Václav, S. Martin, P. Klára // Jazykovedný Časopis. – 2025. – Vol. 76, № 1. – P.

5. Gorozhanov A.I. Natural Language Processing and Fiction Text: Basis for Corpus Research / A.I. Gorozhanov, I.A. Guseinova, D.V. Stepanova // Vestnik Rossiiskogo universiteta druzhby narodov. Seriya: Teoriya yazyka. Semiotika. Semantika. – 2024. – Vol. 15, № 1. – P. 195-210.

6. TIGQA: An Expert Annotated Question Answering Dataset in Tigrinya / H. Teklehaymanot et al // arXiv preprint arXiv:2404. – 17194. – 2024.

7. Nyarko G.S. Leaderships' Role in Quality Assurance Moderating Curriculum Implementation: Perspectives and Preferences of Headteachers and Teachers in Basic Schools in Ghana / G.S. Nyarko // Education Quarterly Reviews. – 2025. – Vol. 8, № 3.

8. Veitsman Y. Recent advancements and challenges of Turkic Central Asian language processing / Y. Veitsman, M. Hartmann // Proceedings of the First Workshop on Language Models for Low-Resource Languages. – 2025. – P. 309-324.

9. Biyik H. Turkish Delights: A Dataset on Turkish Euphemisms / H. Biyik, P. Lee, A. Feldman // Proceedings of the First Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2024). – 2024. – P. 71-80.

10. Kardeş-NLU: Transfer to Low-Resource Languages with the Help of a High-Resource Cousin – A Benchmark and Evaluation for Turkic Languages / L.K. Senel et al // Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics. – 2024. – Vol. 1. – P. 1672-1688.

11. Tutar K. Turkish Question-Answer Dataset Evaluated with Deep Learning / K. Tutar, O.T. Yildiz // 2024 9th International Conference on Computer Science and Engineering (UBMK). – IEEE, 2024. – P. 101-105.

12. Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation / M.A. Bayram et al // arXiv preprint arXiv:2501.00593. – 2024.

13. Kaya Y.B. Effect of Tokenization Granularity for Turkish Large Language Models / Y.B. Kaya, A.C. Tantung // Intelligent Systems with Applications. – 2024. – Vol. 21. – Art. 200335.

14. Development and Evaluation of a Small Kazakh Language Corpus to Improve the Efficiency of Multilingual NLP Systems in Low-Resource Environments / A. Tleubayeva et al // 2025 IEEE 5th International Conference on Smart Information Systems and Technologies (SIST). – IEEE, 2025. – P. 1-6.

15. Aitim A. A Comparison of Kazakh Language Processing Models for Improving Semantic Search Results / A. Aitim, R. Satybaldiyeva // Eastern-European Journal of Enterprise Technologies. – 2025. – Vol. 133, № 2.

16. Machine Learning Methods for Kazakh Morphology: A Comprehensive Overview / I. Akhmetov et al // 2024 IEEE 3rd International Conference on Problems of Informatics, Electronics and Radio Engineering (PIERE). – IEEE, 2024. – P. 1880-1884.


Рецензия

Дәйектеу үшін:


Ергеш М.Ж., Ергеш Б.Ж., Оразаева А.Р., Талғат А. ҚАЗАҚ ТАРИХЫ СҰРАҚ-ЖАУАП КОРПУСЫНЫҢ ҚҰРЫЛЫСЫ ЖӘНЕ ЛИНГВИСТИКАЛЫҚ ТАЛДАУЫ. Шәкәрім Университетінің Хабаршысы. Техникалық ғылымдар сериясы. 2026;1(1(21)):126-135. https://doi.org/10.53360/2788-7995-2026-1(21)-14

For citation:


Yergesh M.Zh., Yergesh B.Zh., Orazayeva A., Talgat А. CONSTRUCTION AND LINGUISTIC ANALYSIS OF THE QUESTION-ANSWER CORPUS OF KAZAKH HISTORYQA. Bulletin of Shakarim University. Technical Sciences. 2026;1(1(21)):126-135. (In Russ.) https://doi.org/10.53360/2788-7995-2026-1(21)-14

Қараулар: 108

JATS XML


ISSN 2788-7995 (Print)
ISSN 3006-0524 (Online)
X