TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Qu, Leigang, Wang, Ziyang, Zheng, Na, Wang, Wenjie, Nie, Liqiang, Chua, Tat-Seng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
Discriminative Probing and Tuning for Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
por: Qu, Leigang, et al.
Publicado: (2024)
por: Qu, Leigang, et al.
Publicado: (2024)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
por: Li, Yongqi, et al.
Publicado: (2024)
por: Li, Yongqi, et al.
Publicado: (2024)
VINCIE: Unlocking In-context Image Editing from Video
por: Qu, Leigang, et al.
Publicado: (2025)
por: Qu, Leigang, et al.
Publicado: (2025)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
por: Liu, Han, et al.
Publicado: (2025)
por: Liu, Han, et al.
Publicado: (2025)
Extending Visual Dynamics for Video-to-Music Generation
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
por: Liu, Kai, et al.
Publicado: (2026)
por: Liu, Kai, et al.
Publicado: (2026)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
por: Chu, Meng, et al.
Publicado: (2023)
por: Chu, Meng, et al.
Publicado: (2023)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
por: Xiao, Junbin, et al.
Publicado: (2023)
por: Xiao, Junbin, et al.
Publicado: (2023)
Scene-Text Grounding for Text-Based Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2024)
por: Zhou, Sheng, et al.
Publicado: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
por: Qin, Bosheng, et al.
Publicado: (2023)
por: Qin, Bosheng, et al.
Publicado: (2023)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
por: Zhou, Sheng, et al.
Publicado: (2025)
por: Zhou, Sheng, et al.
Publicado: (2025)
Using Saliency and Cropping to Improve Video Memorability
por: Mudgal, Vaibhav, et al.
Publicado: (2023)
por: Mudgal, Vaibhav, et al.
Publicado: (2023)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
por: Lan, Xing, et al.
Publicado: (2024)
por: Lan, Xing, et al.
Publicado: (2024)
VideoCLIP-XL: Advancing Long Description Understanding for Video CLIP Models
por: Wang, Jiapeng, et al.
Publicado: (2024)
por: Wang, Jiapeng, et al.
Publicado: (2024)
Principled Multimodal Representation Learning
por: Liu, Xiaohao, et al.
Publicado: (2025)
por: Liu, Xiaohao, et al.
Publicado: (2025)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Recipe Generation from Unsegmented Cooking Videos
por: Nishimura, Taichi, et al.
Publicado: (2022)
por: Nishimura, Taichi, et al.
Publicado: (2022)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
por: Geng, Tiantian, et al.
Publicado: (2024)
por: Geng, Tiantian, et al.
Publicado: (2024)
EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis
por: Fang, Jianwu, et al.
Publicado: (2025)
por: Fang, Jianwu, et al.
Publicado: (2025)
KeyVideoLLM: Towards Large-scale Video Keyframe Selection
por: Liang, Hao, et al.
Publicado: (2024)
por: Liang, Hao, et al.
Publicado: (2024)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
por: An, Wenbin, et al.
Publicado: (2025)
por: An, Wenbin, et al.
Publicado: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
por: Zhao, Zhixian, et al.
Publicado: (2026)
por: Zhao, Zhixian, et al.
Publicado: (2026)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
por: Luo, Ziyang, et al.
Publicado: (2024)
por: Luo, Ziyang, et al.
Publicado: (2024)
Enhancing the Learning Experience: Using Vision-Language Models to Generate Questions for Educational Videos
por: Stamatakis, Markos, et al.
Publicado: (2025)
por: Stamatakis, Markos, et al.
Publicado: (2025)
Towards Event-oriented Long Video Understanding
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation
por: Xu, Jiaqi, et al.
Publicado: (2024)
por: Xu, Jiaqi, et al.
Publicado: (2024)
VideoMem: Constructing, Analyzing, Predicting Short-term and Long-term Video Memorability
por: Cohendet, Romain, et al.
Publicado: (2018)
por: Cohendet, Romain, et al.
Publicado: (2018)
Consistency-aware Fake Videos Detection on Short Video Platforms
por: Wang, Junxi, et al.
Publicado: (2025)
por: Wang, Junxi, et al.
Publicado: (2025)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
por: Zhou, Yuchen, et al.
Publicado: (2025)
por: Zhou, Yuchen, et al.
Publicado: (2025)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
por: Chen, Yijing, et al.
Publicado: (2025)
por: Chen, Yijing, et al.
Publicado: (2025)
Ejemplares similares
-
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
por: Li, Yongqi, et al.
Publicado: (2024) -
Discriminative Probing and Tuning for Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024) -
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
por: Qu, Leigang, et al.
Publicado: (2024) -
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
por: Qu, Leigang, et al.
Publicado: (2024) -
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
por: Li, Yongqi, et al.
Publicado: (2024)