Enregistré dans:
| Auteurs principaux: | Tang, Yolo Y., Bi, Jing, Xu, Siting, Song, Luchuan, Liang, Susan, Wang, Teng, Zhang, Daoan, An, Jie, Lin, Jingyang, Zhu, Rongyi, Vosoughi, Ali, Huang, Chao, Zhang, Zeliang, Liu, Pinxin, Feng, Mingqian, Zheng, Feng, Zhang, Jianguo, Luo, Ping, Luo, Jiebo, Xu, Chenliang |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2312.17432 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
GaussianStyle: Gaussian Head Avatar via StyleGAN
par: Liu, Pinxin, et autres
Publié: (2024)
par: Liu, Pinxin, et autres
Publié: (2024)
Generative AI for Cel-Animation: A Survey
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
Forward Learning for Gradient-based Black-box Saliency Map Generation
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
par: Tang, Yunlong, et autres
Publié: (2025)
par: Tang, Yunlong, et autres
Publié: (2025)
Will the Inclusion of Generated Data Amplify Bias Across Generations in Future Image Classification Models?
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
Why Reasoning Matters? A Survey of Advancements in Multimodal Reasoning (v1)
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
TDMM-LM: Bridging Facial Understanding and Animation via Language Models
par: Song, Luchuan, et autres
Publié: (2026)
par: Song, Luchuan, et autres
Publié: (2026)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
par: Feng, Mingqian, et autres
Publié: (2024)
par: Feng, Mingqian, et autres
Publié: (2024)
Discover and Mitigate Multiple Biased Subgroups in Image Classifiers
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
par: Tang, Yolo Yunlong, et autres
Publié: (2024)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
par: Liang, Susan, et autres
Publié: (2026)
par: Liang, Susan, et autres
Publié: (2026)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
Learning to Transform Dynamically for Better Adversarial Transferability
par: Zhu, Rongyi, et autres
Publié: (2024)
par: Zhu, Rongyi, et autres
Publié: (2024)
Adaptive Super Resolution For One-Shot Talking-Head Generation
par: Song, Luchuan, et autres
Publié: (2024)
par: Song, Luchuan, et autres
Publié: (2024)
VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?
par: Tang, Yolo Y., et autres
Publié: (2024)
par: Tang, Yolo Y., et autres
Publié: (2024)
Tri$^{2}$-plane: Thinking Head Avatar via Feature Pyramid
par: Song, Luchuan, et autres
Publié: (2024)
par: Song, Luchuan, et autres
Publié: (2024)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
par: Liu, Pinxin, et autres
Publié: (2025)
par: Liu, Pinxin, et autres
Publié: (2025)
TextToon: Real-Time Text Toonify Head Avatar from Single Video
par: Song, Luchuan, et autres
Publié: (2024)
par: Song, Luchuan, et autres
Publié: (2024)
Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning
par: Tan, Zhangyun, et autres
Publié: (2026)
par: Tan, Zhangyun, et autres
Publié: (2026)
$I^2G$: Generating Instructional Illustrations via Text-Conditioned Diffusion
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
LaunchpadGPT: Language Model as Music Visualization Designer on Launchpad
par: Xu, Siting, et autres
Publié: (2023)
par: Xu, Siting, et autres
Publié: (2023)
EAGLE: Egocentric AGgregated Language-video Engine
par: Bi, Jing, et autres
Publié: (2024)
par: Bi, Jing, et autres
Publié: (2024)
Intentional Gesture: Deliver Your Intentions with Gestures for Speech
par: Liu, Pinxin, et autres
Publié: (2025)
par: Liu, Pinxin, et autres
Publié: (2025)
When to Think and When to Look: Uncertainty-Guided Lookback
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
Video-LMM Post-Training: A Deep Dive into Video Reasoning with Large Multimodal Models
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
Rethinking Audio-Visual Adversarial Vulnerability from Temporal and Modality Perspectives
par: Zhang, Zeliang, et autres
Publié: (2025)
par: Zhang, Zeliang, et autres
Publié: (2025)
Learning Brain Tumor Representation in 3D High-Resolution MR Images via Interpretable State Space Models
par: Hu, Qingqiao, et autres
Publié: (2024)
par: Hu, Qingqiao, et autres
Publié: (2024)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
par: Zhang, Daoan, et autres
Publié: (2025)
par: Zhang, Daoan, et autres
Publié: (2025)
Multi-modal Segment Assemblage Network for Ad Video Editing with Importance-Coherence Reward
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
par: Tang, Yolo Yunlong, et autres
Publié: (2022)
Forward Learning with Differential Privacy
par: Feng, Mingqian, et autres
Publié: (2025)
par: Feng, Mingqian, et autres
Publié: (2025)
Can Sound Replace Vision in LLaVA With Token Substitution?
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Sphinx: Benchmarking and Modeling for LLM-Driven Pull Request Review
par: Zhang, Daoan, et autres
Publié: (2026)
par: Zhang, Daoan, et autres
Publié: (2026)
OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity
par: Bi, Jing, et autres
Publié: (2025)
par: Bi, Jing, et autres
Publié: (2025)
A Versatile Multimodal Agent for Multimedia Content Generation
par: Zhang, Daoan, et autres
Publié: (2026)
par: Zhang, Daoan, et autres
Publié: (2026)
LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Harnessing the Computation Redundancy in ViTs to Boost Adversarial Transferability
par: Liu, Jiani, et autres
Publié: (2025)
par: Liu, Jiani, et autres
Publié: (2025)
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
par: Tang, Yolo Y., et autres
Publié: (2025)
par: Tang, Yolo Y., et autres
Publié: (2025)
Documents similaires
-
MMPerspective: Do MLLMs Understand Perspective? A Comprehensive Benchmark for Perspective Perception, Reasoning, and Robustness
par: Tang, Yolo Y., et autres
Publié: (2025) -
GaussianStyle: Gaussian Head Avatar via StyleGAN
par: Liu, Pinxin, et autres
Publié: (2024) -
Generative AI for Cel-Animation: A Survey
par: Tang, Yolo Y., et autres
Publié: (2025) -
Forward Learning for Gradient-based Black-box Saliency Map Generation
par: Zhang, Zeliang, et autres
Publié: (2024) -
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
par: Zhang, Zeliang, et autres
Publié: (2024)