Written by 1:24 am Arsip Kuliah, Berita Teknologi, Trending

MultiModal-GPT: Sebuah Model Bahasa dan Visi untuk Berdialog dengan Manusia

MultiModal-GPT merupakan sebuah model bahasa dan visi yang inovatif yang digunakan untuk berdialog …

MultiModal-GPT merupakan sebuah model bahasa dan visi yang inovatif yang digunakan untuk berdialog dengan manusia secara multi-round. Model ini dapat mengikuti instruksi dari manusia, seperti membuat deskripsi yang detail, menghitung jumlah objek tertentu, dan menjawab pertanyaan umum dari pengguna. Dalam pengembangannya, MultiModal-GPT menggunakan teknologi yang efisien dalam memfine-tune OpenFlamingo dengan Low-rank Adapter (LoRA) pada bagian cross-attention dan self-attention dari model bahasa. Model ini juga dilatih dengan data instruksi multi-modality dengan menggunakan template instruksi yang dikonstruksi dari data bahasa dan visi. Dalam penelitian ini, kualitas data pelatihan dianggap penting dalam meningkatkan performa dialog dengan manusia, di mana data dengan jawaban yang singkat dapat mempengaruhi respon model terhadap instruksi. Melalui joint training, MultiModal-GPT juga ditingkatkan kemampuannya dalam berdialog dengan manusia dengan memanfaatkan data instruksi berbahasa dan visual. Dengan berbagai demo yang disajikan, MultiModal-GPT menunjukkan kemampuannya dalam berdialog secara kontinu dengan manusia.

MultiModal-GPT: Sebuah Model Bahasa dan Visi untuk Berdialog dengan Manusia

Diterbitkan oleh Tao Gong, Chengqi Lyu, Shilong Zhang, Yudong Wang, Miao Zheng, Qian Zhao, Kuikun Liu, Wenwei Zhang, Ping Luo, Kai Chen pada 8 Mei 2023.

Ringkasan

Kami mempersembahkan sebuah model bahasa dan visi bernama MultiModal-GPT untuk melakukan dialog multi-putaran dengan manusia. MultiModal-GPT dapat mengikuti berbagai instruksi dari manusia, seperti menghasilkan keterangan rinci, menghitung jumlah objek yang menarik, dan menjawab pertanyaan umum dari pengguna. MultiModal-GPT disesuaikan secara efisien parameter dari OpenFlamingo, dengan Low-rank Adapter (LoRA) ditambahkan baik dalam bagian cross-attention maupun bagian self-attention dari model bahasa. Pertama-tama, kami membuat template instruksi dengan data bahasa dan visi untuk penalaan instruksi multi-modalitas agar model memahami dan mengikuti instruksi manusia. Kami menemukan bahwa kualitas data pelatihan sangat penting untuk kinerja dialog, di mana sedikit data yang berisi jawaban singkat dapat membuat model memberikan respon yang singkat terhadap setiap instruksi. Untuk lebih meningkatkan kemampuan MultiModal-GPT dalam berbicara dengan manusia, kami memanfaatkan data pemantauan instruksi hanya bahasa untuk melatih MultiModal-GPT secara bersama-sama. Pelatihan bersama instruksi bahasa saja dan visual-bahasa dengan template instruksi yang sama secara efektif meningkatkan kinerja dialog. Berbagai demo menunjukkan kemampuan dialog terus-menerus MultiModal-GPT dengan manusia. Kode dan demo tersedia di https://github.com/open-mmlab/Multimodal-GPT.

Ref journal : huggingface.co , arxiv.org

(Visited 1 times, 1 visits today)
Subscribe to my email list and stay up-to-date!
Close