Вербальная составляющая видеоигрового текста как ресурс для дообучения больших языковых моделей
DOI:
https://doi.org/10.33910/2686-830X-2026-8-1-6-13Ключевые слова:
видеоигровой текст, вербальная составляющая, дообучение нейросети, машинное обучение, большая языковая модельАннотация
Исследование выполнено в русле цифровой лингвистики, в задачи которой входит изучение параметров обработки естественного языка. Проблемы больших языковых моделей с пониманием коммуникативного контекста связаны с фундаментальными ограничениями их природы, среди которых отсутствие подлинного эмоционального интеллекта, сложность интерпретации мультимодальных сигналов, трудности с контекстным пониманием ситуации. Одним из путей преодоления этих ограничений может быть использование метода дообучения на специализированных наборах данных. В статье рассматривается вербальная составляющая поликодового текста видеоигры как важнейший компонент мультимодального дискурса, определяющий восприятие событий, персонажей и характер взаимодействия игрока с виртуальным игровым миром. Особое внимание уделяется специфическим характеристикам языкового материала видеоигр: сложности и глубине лексической, синтаксической и стилистической организации игровых диалогов, эмоциональной насыщенности, функциональной информативности и контекстуальной изменчивости. Показано, что игровые диалоги обладают встроенной аннотацией эмоций и прагматических функций, что делает их ценным ресурсом для задач обработки естественного языка, включая анализ тональности, распознавание речевых актов и обучение эмпатичных языковых моделей. На материале фрагментов из вербальной составляющей видеоигры Disco Elysium продемонстрирована реализация эмоциональных и контекстных параметров речи персонажей в англоязычной и русскоязычной версии. Отмечается значимость видеоигровых текстов как источника языковых данных для исследований в области корпусных технологий и машинного обучения. Делается вывод о том, что вербальный компонент видеоигр представляет собой не только художественный инструмент нарративной организации, но и перспективную базу для развития интерактивных интерфейсов и контекстно-чувствительных языковых моделей.
Библиографические ссылки
СПИСОК ЛИТЕРАТУРЫ
Кац, Н. Г., Рубцова, А. В., Аитов, В. Ф. (2024) Иноязычный мультимодальный текст как основа разработки учебных материалов для цифровой образовательной среды вуза. Вестник Томского государственного университета, № 504, с. 156–163. https://doi.org/10.17223/15617793/504/17
Кожемякин, Е. А., Иванова, Л. В., Куприянова, А. В. (2024) Прагматический аспект мультимодальной журналистской коммуникации: взаимодействие реципиентов с цифровым дата-текстом. Вестник Московского университета. Серия 10: Журналистика, т. 49, № 3, с. 89–121.
Финогеева, А. А. (2021) Мультимодальность в современном университетском интернет-дискурсе. Russian Linguistic Bulletin, № 4 (28), с. 162–165. https://doi.org/10.18454/RULB.2021.28.4.39
Blum, A., Mitchell, T. (1998) Combining Labeled and Unlabeled Data with Co-Training. In: COLT’ 98: Proceedings of the eleventh annual conference on Computational learning theory. New York: Association for Computing Machinery Publ., pp. 92–100. https://doi.org/10.1145/279943.279962
Callison-Burch, C., Dredze, M. (2010) Creating Speech and Language Data with Amazon’s Mechanical Turk. In: Proceedings of the NAACL HLT 2009 Workshop on Creating Speech and Language Data with Amazon Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 1–12.
Finin, T., Murnane, W., Karandikar, A. et al. (2010) Annotating Named Entities in Twitter Data with Crowdsourcing. In: Proceedings of the NAACL HLT 2010 Workshop on Creating Speech and Language Data with Amazon’s Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 80–88.
Hämäläinen, M., Alnajjar, K., Poibeau, T. (2022) Video Games as a Corpus: Sentiment Analysis using Fallout New Vegas Dialog. arXiv. [Online]. Available at: https://doi.org/10.48550/arXiv.2212.02168 (дата обращения 20.09.2025).
Juraska, J., Bowden, K., Walker, M. (2019) ViGGO: A Video Game Corpus for Data-To-Text Generation in Open- Domain Conversation. In: Proceedings of the 12th International Conference on Natural Language Generation. Tokyo: Association for Computational Linguistics Publ., pp. 164–172. https://doi.org/10.18653/v1/W19-8623
Nangia, N., Bowman, S. R. (2019) Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark. In: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Florence: Association for Computational Linguistics Publ., pp. 4566–4575. https://doi.org/10.18653/v1/P19-1449
Pavlick, E., Post, M., Irvine, A. et al. (2014) The Language Demographics of Amazon Mechanical Turk. Transactions of the Association for Computational Linguistics, vol. 2, pp. 79–92 https://doi.org/10.1162/tacl_a_00167
Rennick, S., Roberts, S. G. (2023) The Video Game Dialogue Corpus. Corpora, vol. 19, no. 1, pp. 93–106. https://doi.org/10.3366/cor.2024.0299
Zhu, X. (2005) Semi-Supervised Learning Literature Survey. Madison: University of Wisconsin Publ., 60 p.
SOURCES
Disco Elysium. (2025) [Online]. Available at: https://store.steampowered.com/app/632470/Disco_Elysium__The_Final_Cut/ (accessed 20.09.2025).
Disco Elysium Wiki. (2025) [Online]. Available at: https://discoelysium.fandom.com/wiki/Disco_Elysium_Wiki (accessed 20.09.2025)
Disco Reader. (2025) [Online]. Available at: https://disco-reader.gitlab.io/disco-reader/#/ (accessed 20.09.2025)
REFERENCES
Blum, A., Mitchell, T. (1998) Combining Labeled and Unlabeled Data with Co-Training. In: COLT’ 98: Proceedings of the eleventh annual conference on Computational learning theory. New York: Association for Computing Machinery Publ., pp. 92–100. https://doi.org/10.1145/279943.279962 (In English)
Callison-Burch, C., Dredze, M. (2010) Creating Speech and Language Data with Amazon’s Mechanical Turk. In: Proceedings of the NAACL HLT 2009 Workshop on Creating Speech and Language Data with Amazon Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 1–12. (In English)
Finin, T., Murnane, W., Karandikar, A. et al. (2010) Annotating Named Entities in Twitter Data with Crowdsourcing. In: Proceedings of the NAACL HLT 2010 Workshop on Creating Speech and Language Data with Amazon’s Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 80–88. (In English)
Finogeeva, A. A. (2021) Multimodality in the modern internet discourse. Russian Linguistic Bulletin, vol. 4 (28), pp. 162–165. https://doi.org/10.18454/RULB.2021.28.4.39 (In Russian)
Hämäläinen, M., Alnajjar, K., Poibeau, T. (2022) Video Games as a Corpus: Sentiment Analysis using Fallout New Vegas Dialog. arXiv. [Online]. Available at: https://doi.org/10.48550/arXiv.2212.02168 (дата обращения 20.09.2025). (In English)
Juraska, J., Bowden, K., Walker, M. (2019) ViGGO: A Video Game Corpus for Data-To-Text Generation in Open- Domain Conversation. In: Proceedings of the 12th International Conference on Natural Language Generation. Tokyo: Association for Computational Linguistics Publ., pp. 164–172. https://doi.org/10.18653/v1/W19-8623 (In English)
Kats, N. G., Rubtsova, A. V., Aitov, V. F. (2024) Multimodal text as the basis of instructional material design in an academic digital environment. Tomsk State University Journal, vol. 504, pp. 156–163. https://doi.org/10.17223/15617793/504/17 (In Russian)
Kozhemyakin, E. A., Ivanova, L. V., Kupriyanova, A. V. (2024) Pragmatic aspect of multimodal journalistic communication: interaction of recipients with digital data-text. Vestnik Moskovskogo universiteta. Seriya 10. Zhurnalistika, vol. 49, no. 3, pp. 89–121. (In Russian)
Nangia, N., Bowman, S. R. (2019) Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark. In: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Florence: Association for Computational Linguistics Publ., pp. 4566–4575. https://doi.org/10.18653/v1/P19-1449 (In English)
Pavlick, E., Post, M., Irvine, A. et al. (2014) The Language Demographics of Amazon Mechanical Turk. Transactions of the Association for Computational Linguistics, vol. 2, pp. 79–92 https://doi.org/10.1162/tacl_a_00167 (In English)
Rennick, S., Roberts, S. G. (2023) The Video Game Dialogue Corpus. Corpora, vol. 19, no. 1, pp. 93–106. https://doi.org/10.3366/cor.2024.0299 (In English)
Zhu, X. (2005) Semi-Supervised Learning Literature Survey. Madison: University of Wisconsin Publ., 60 p. (In English)
Загрузки
Опубликован
Выпуск
Раздел
Лицензия
Copyright (c) 2026 Ольга Юрьевна Кустова, Глеб Александрович Полтавец

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Авторы предоставляют материалы на условиях публичной оферты и лицензии CC BY 4.0. Эта лицензия позволяет неограниченному кругу лиц копировать и распространять материал на любом носителе и в любом формате в любых целях, делать ремиксы, видоизменять, и создавать новое, опираясь на этот материал в любых целях, включая коммерческие.
Данная лицензия сохраняет за автором права на статью, но разрешает другим свободно распространять, использовать и адаптировать работу при обязательном условии указания авторства. Пользователи должны предоставить корректную ссылку на оригинальную публикацию в нашем журнале, указать имена авторов и отметить факт внесения изменений (если таковые были).
Авторские права сохраняются за авторами. Лицензия CC BY 4.0 не передает права третьим лицам, а лишь предоставляет пользователям заранее данное разрешение на использование при соблюдении условия атрибуции. Любое использование будет происходить на условиях этой лицензии. Право на номер журнала как составное произведение принадлежит издателю.





