EVJVQA challenge: multilingual visual question answering
Tác giả: Ngan Luu-Thuy Nguyen, Nghia Hieu Nguyen, Duong T.D. Vo, Khanh Quoc Tran, Kiet Van Nguyen
Số trang:
P. 237-258
Số phát hành:
Tập 39 - Số 3
Kiểu tài liệu:
Tạp chí trong nước
Nơi lưu trữ:
03 Quang Trung
Mã phân loại:
005
Ngôn ngữ:
English
Từ khóa:
Computer science, visual question answering, vision-language understanding, multiModal learning, information fusion, transformer model
Chủ đề:
Computer science
Tóm tắt:
In this article, we present details of the organization of the challenge, an overview of the methods employed by shared-task participants, and the results. The highest performances are 0.4392 in F1-score and 0.4009 in BLUE on the private test set. The multilingual QA systems proposed by the top 2 teams use ViT for the pre-trained vision model and mT5 for the pre-trained language model, a powerful pre-trained language model based on the transformer architecture. EVJVQA is a challenging dataset that motivates NLP and CV researchers to further explore the multilingual models or systems for visual question answering systems.
Tạp chí liên quan
- Phân hạng nguy hiểm cháy và cháy nổ cho nhà sản xuất có nguy cơ nổ bụi tại Việt Nam
- Ảnh hưởng của đường quan hệ lực cắt - chuyển vị ngang của gối cách chấn đa lớp đến hiệu quả giảm chấn của nhà cách chấn đáy có kết cấu tường gạch
- Nâng cao hiệu quả nhận dạng các tham số dao động dựa trên kỹ thuật tách nguồn mù
- Ảnh hưởng của sườn đứng đến khả năng chịu nén đúng tâm của khối xây bằng gạch đất không nung
- Nguyên nhân phá hủy bề mặt gạch tháp Khương Mỹ và giải pháp hạn chế hư hỏng gạch phục chế, sử dụng gia cường khối xây tháp trong môi trường biển