Enhancing Vision-Audio Capability in Omnimodal LLMs with Self-KD
Introduction: The Challenge of Audio-Vision Integration in Omnimodal LLMs Omnimodal Large Language Models (OLLMs) like GPT-4o and Megrez have revolutionized how AI interacts with the world by seamlessly processing text, images, and audio. However, a critical performance gap persists: OLLMs perform significantly better with vision-text inputs than with vision-audio inputs. For example, when asked “What’s […]
Enhancing Vision-Audio Capability in Omnimodal LLMs with Self-KD Read More »










