OpenMOSS-Team/MOSS-VL-Instruct-0708-NF4
Video-Text-to-Text β’ 11B β’ Updated β’ 38 β’ 13
LLM
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation