Вербальная составляющая видеоигрового текста как ресурс для дообучения больших языковых моделей

Авторы

  • Ольга Юрьевна Кустова Российский государственный педагогический университет им. А. И. Герцена https://orcid.org/0000-0002-8422-0646
  • Глеб Александрович Полтавец Российский государственный педагогический университет им. А. И. Герцена https://orcid.org/0009-0002-8704-5633

DOI:

https://doi.org/10.33910/2686-830X-2026-8-1-6-13

Ключевые слова:

видеоигровой текст, вербальная составляющая, дообучение нейросети, машинное обучение, большая языковая модель

Аннотация

Исследование выполнено в русле цифровой лингвистики, в задачи которой входит изучение параметров обработки естественного языка. Проблемы больших языковых моделей с пониманием коммуникативного контекста связаны с фундаментальными ограничениями их природы, среди которых отсутствие подлинного эмоционального интеллекта, сложность интерпретации мультимодальных сигналов, трудности с контекстным пониманием ситуации. Одним из путей преодоления этих ограничений может быть использование метода дообучения на специализированных наборах данных. В статье рассматривается вербальная составляющая поликодового текста видеоигры как важнейший компонент мультимодального дискурса, определяющий восприятие событий, персонажей и характер взаимодействия игрока с виртуальным игровым миром. Особое внимание уделяется специфическим характеристикам языкового материала видеоигр: сложности и глубине лексической, синтаксической и стилистической организации игровых диалогов, эмоциональной насыщенности, функциональной информативности и контекстуальной изменчивости. Показано, что игровые диалоги обладают встроенной аннотацией эмоций и прагматических функций, что делает их ценным ресурсом для задач обработки естественного языка, включая анализ тональности, распознавание речевых актов и обучение эмпатичных языковых моделей. На материале фрагментов из вербальной составляющей видеоигры Disco Elysium продемонстрирована реализация эмоциональных и контекстных параметров речи персонажей в англоязычной и русскоязычной версии. Отмечается значимость видеоигровых текстов как источника языковых данных для исследований в области корпусных технологий и машинного обучения. Делается вывод о том, что вербальный компонент видеоигр представляет собой не только художественный инструмент нарративной организации, но и перспективную базу для развития интерактивных интерфейсов и контекстно-чувствительных языковых моделей.

Библиографические ссылки

СПИСОК ЛИТЕРАТУРЫ

Кац, Н. Г., Рубцова, А. В., Аитов, В. Ф. (2024) Иноязычный мультимодальный текст как основа разработки учебных материалов для цифровой образовательной среды вуза. Вестник Томского государственного университета, № 504, с. 156–163. https://doi.org/10.17223/15617793/504/17

Кожемякин, Е. А., Иванова, Л. В., Куприянова, А. В. (2024) Прагматический аспект мультимодальной журналистской коммуникации: взаимодействие реципиентов с цифровым дата-текстом. Вестник Московского университета. Серия 10: Журналистика, т. 49, № 3, с. 89–121.

Финогеева, А. А. (2021) Мультимодальность в современном университетском интернет-дискурсе. Russian Linguistic Bulletin, № 4 (28), с. 162–165. https://doi.org/10.18454/RULB.2021.28.4.39

Blum, A., Mitchell, T. (1998) Combining Labeled and Unlabeled Data with Co-Training. In: COLT’ 98: Proceedings of the eleventh annual conference on Computational learning theory. New York: Association for Computing Machinery Publ., pp. 92–100. https://doi.org/10.1145/279943.279962

Callison-Burch, C., Dredze, M. (2010) Creating Speech and Language Data with Amazon’s Mechanical Turk. In: Proceedings of the NAACL HLT 2009 Workshop on Creating Speech and Language Data with Amazon Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 1–12.

Finin, T., Murnane, W., Karandikar, A. et al. (2010) Annotating Named Entities in Twitter Data with Crowdsourcing. In: Proceedings of the NAACL HLT 2010 Workshop on Creating Speech and Language Data with Amazon’s Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 80–88.

Hämäläinen, M., Alnajjar, K., Poibeau, T. (2022) Video Games as a Corpus: Sentiment Analysis using Fallout New Vegas Dialog. arXiv. [Online]. Available at: https://doi.org/10.48550/arXiv.2212.02168 (дата обращения 20.09.2025).

Juraska, J., Bowden, K., Walker, M. (2019) ViGGO: A Video Game Corpus for Data-To-Text Generation in Open- Domain Conversation. In: Proceedings of the 12th International Conference on Natural Language Generation. Tokyo: Association for Computational Linguistics Publ., pp. 164–172. https://doi.org/10.18653/v1/W19-8623

Nangia, N., Bowman, S. R. (2019) Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark. In: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Florence: Association for Computational Linguistics Publ., pp. 4566–4575. https://doi.org/10.18653/v1/P19-1449

Pavlick, E., Post, M., Irvine, A. et al. (2014) The Language Demographics of Amazon Mechanical Turk. Transactions of the Association for Computational Linguistics, vol. 2, pp. 79–92 https://doi.org/10.1162/tacl_a_00167

Rennick, S., Roberts, S. G. (2023) The Video Game Dialogue Corpus. Corpora, vol. 19, no. 1, pp. 93–106. https://doi.org/10.3366/cor.2024.0299

Zhu, X. (2005) Semi-Supervised Learning Literature Survey. Madison: University of Wisconsin Publ., 60 p.

SOURCES

Disco Elysium. (2025) [Online]. Available at: https://store.steampowered.com/app/632470/Disco_Elysium__The_Final_Cut/ (accessed 20.09.2025).

Disco Elysium Wiki. (2025) [Online]. Available at: https://discoelysium.fandom.com/wiki/Disco_Elysium_Wiki (accessed 20.09.2025)

Disco Reader. (2025) [Online]. Available at: https://disco-reader.gitlab.io/disco-reader/#/ (accessed 20.09.2025)

REFERENCES

Blum, A., Mitchell, T. (1998) Combining Labeled and Unlabeled Data with Co-Training. In: COLT’ 98: Proceedings of the eleventh annual conference on Computational learning theory. New York: Association for Computing Machinery Publ., pp. 92–100. https://doi.org/10.1145/279943.279962 (In English)

Callison-Burch, C., Dredze, M. (2010) Creating Speech and Language Data with Amazon’s Mechanical Turk. In: Proceedings of the NAACL HLT 2009 Workshop on Creating Speech and Language Data with Amazon Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 1–12. (In English)

Finin, T., Murnane, W., Karandikar, A. et al. (2010) Annotating Named Entities in Twitter Data with Crowdsourcing. In: Proceedings of the NAACL HLT 2010 Workshop on Creating Speech and Language Data with Amazon’s Mechanical Turk. Los Angeles: Association for Computational Linguistics Publ., pp. 80–88. (In English)

Finogeeva, A. A. (2021) Multimodality in the modern internet discourse. Russian Linguistic Bulletin, vol. 4 (28), pp. 162–165. https://doi.org/10.18454/RULB.2021.28.4.39 (In Russian)

Hämäläinen, M., Alnajjar, K., Poibeau, T. (2022) Video Games as a Corpus: Sentiment Analysis using Fallout New Vegas Dialog. arXiv. [Online]. Available at: https://doi.org/10.48550/arXiv.2212.02168 (дата обращения 20.09.2025). (In English)

Juraska, J., Bowden, K., Walker, M. (2019) ViGGO: A Video Game Corpus for Data-To-Text Generation in Open- Domain Conversation. In: Proceedings of the 12th International Conference on Natural Language Generation. Tokyo: Association for Computational Linguistics Publ., pp. 164–172. https://doi.org/10.18653/v1/W19-8623 (In English)

Kats, N. G., Rubtsova, A. V., Aitov, V. F. (2024) Multimodal text as the basis of instructional material design in an academic digital environment. Tomsk State University Journal, vol. 504, pp. 156–163. https://doi.org/10.17223/15617793/504/17 (In Russian)

Kozhemyakin, E. A., Ivanova, L. V., Kupriyanova, A. V. (2024) Pragmatic aspect of multimodal journalistic communication: interaction of recipients with digital data-text. Vestnik Moskovskogo universiteta. Seriya 10. Zhurnalistika, vol. 49, no. 3, pp. 89–121. (In Russian)

Nangia, N., Bowman, S. R. (2019) Human vs. Muppet: A Conservative Estimate of Human Performance on the GLUE Benchmark. In: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Florence: Association for Computational Linguistics Publ., pp. 4566–4575. https://doi.org/10.18653/v1/P19-1449 (In English)

Pavlick, E., Post, M., Irvine, A. et al. (2014) The Language Demographics of Amazon Mechanical Turk. Transactions of the Association for Computational Linguistics, vol. 2, pp. 79–92 https://doi.org/10.1162/tacl_a_00167 (In English)

Rennick, S., Roberts, S. G. (2023) The Video Game Dialogue Corpus. Corpora, vol. 19, no. 1, pp. 93–106. https://doi.org/10.3366/cor.2024.0299 (In English)

Zhu, X. (2005) Semi-Supervised Learning Literature Survey. Madison: University of Wisconsin Publ., 60 p. (In English)

Опубликован

16.05.2026

Выпуск

Раздел

Лингвистика и междисциплинарные исследования языка и речи

Похожие статьи

1-10 из 56

Вы также можете начать расширеннвй поиск похожих статей для этой статьи.