VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors Paper • 2604.02486 • Published Apr 2 • 12
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_spkEmbUncond_LATEST 1B • Updated May 24 • 2
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_spkEmbUncond_LATEST 1B • Updated May 24 • 2
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_LATEST 1B • Updated May 21 • 2
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_LATEST 1B • Updated May 21 • 2
Jiwon-Kang/emilla_full_voxcpm_v1_whisper_batch64_patch4_ddt_shift6.32_dit4_noise0.0_LATEST Updated May 21 • 19