GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Yicheng, Zhang, Zhikang, Wang, Jue, Fan, David, Xu, Zhenlin, Liu, Linda, Hao, Xiang, Bhat, Vimal, Li, Xinyu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Text-Guided Video Masked Autoencoder
di: Fan, David, et al.
Pubblicazione: (2024)
di: Fan, David, et al.
Pubblicazione: (2024)
NowYouSee Me: Context-Aware Automatic Audio Description
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024)
RefTok: Reference-Based Tokenization for Video Generation
di: Fan, Xiang, et al.
Pubblicazione: (2025)
di: Fan, Xiang, et al.
Pubblicazione: (2025)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
di: Zhang, Zheyu, et al.
Pubblicazione: (2026)
DiffSign: AI-Assisted Generation of Customizable Sign Language Videos With Enhanced Realism
di: Krishnamurthy, Sudha, et al.
Pubblicazione: (2024)
di: Krishnamurthy, Sudha, et al.
Pubblicazione: (2024)
HOQRI: Higher-order QR Iteration for Low Multilinear Rank Approximation of Large and Sparse Tensors
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
di: Sun, Yuchen, et al.
Pubblicazione: (2025)
DeepWKB: Learning WKB Expansions of Invariant Distributions for Stochastic Systems
di: Li, Yao, et al.
Pubblicazione: (2025)
di: Li, Yao, et al.
Pubblicazione: (2025)
Efficient and Scalable Graph Generation through Iterative Local Expansion
di: Bergmeister, Andreas, et al.
Pubblicazione: (2023)
di: Bergmeister, Andreas, et al.
Pubblicazione: (2023)
Multi-Granularity and Multi-modal Feature Interaction Approach for Text Video Retrieval
di: Li, Wenjun, et al.
Pubblicazione: (2024)
di: Li, Wenjun, et al.
Pubblicazione: (2024)
STORM: End-to-End Referring Multi-Object Tracking in Videos
di: Lu, Zijia, et al.
Pubblicazione: (2026)
di: Lu, Zijia, et al.
Pubblicazione: (2026)
Elastic Molecular‐Assisted Fabrication of Orthorhombic Non‐Perovskite CsPbI2Br for Ultralow Dark Current in Advanced X‐Ray Imaging
di: Ting Han, et al.
Pubblicazione: (2024)
di: Ting Han, et al.
Pubblicazione: (2024)
VeRVE: Versatile Retrieval for Videos via Unified Embeddings
di: Halbe, Shaunak, et al.
Pubblicazione: (2026)
di: Halbe, Shaunak, et al.
Pubblicazione: (2026)
A Self-scaled Approximate $\ell_0$ Regularization Robust Model for Outlier Detection
di: Song, Pengyang, et al.
Pubblicazione: (2025)
di: Song, Pengyang, et al.
Pubblicazione: (2025)
What Happens Next? Next Scene Prediction with a Unified Video Model
di: Li, Xinjie, et al.
Pubblicazione: (2025)
di: Li, Xinjie, et al.
Pubblicazione: (2025)
Multi-Granularity Video Object Segmentation
di: Lim, Sangbeom, et al.
Pubblicazione: (2024)
di: Lim, Sangbeom, et al.
Pubblicazione: (2024)
Dense Retrievers Can Fail on Simple Queries: Revealing The Granularity Dilemma of Embeddings
di: Xu, Liyan, et al.
Pubblicazione: (2025)
di: Xu, Liyan, et al.
Pubblicazione: (2025)
Thinking in Granularity: Dynamic Quantization for Image Super-Resolution by Intriguing Multi-Granularity Clues
di: Wang, Mingshen, et al.
Pubblicazione: (2024)
di: Wang, Mingshen, et al.
Pubblicazione: (2024)
Accelerating Expansion of the Universe in modified gravity with quadratic terms
di: Bhat, Aaqid
Pubblicazione: (2025)
di: Bhat, Aaqid
Pubblicazione: (2025)
Quantifying the Macroeconomic Impact of Credit Expansions
di: Corina Boar, et al.
Pubblicazione: (2025)
di: Corina Boar, et al.
Pubblicazione: (2025)
Diffusion Approximation for Slow-Fast SDEs with State-Dependent Switching
di: Sun, Xiaobin, et al.
Pubblicazione: (2025)
di: Sun, Xiaobin, et al.
Pubblicazione: (2025)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
di: Xu, Zhenlin, et al.
Pubblicazione: (2023)
di: Xu, Zhenlin, et al.
Pubblicazione: (2023)
GBO:AMulti-Granularity Optimization Algorithm via Granular-ball for Continuous Problems
di: Xia, Shuyin, et al.
Pubblicazione: (2023)
di: Xia, Shuyin, et al.
Pubblicazione: (2023)
‘I Want to Learn and Speak Hoche, Rather I Am Becoming Han’: Amplifying Minoritized Indigenous Children's Voices Through a Multilingual Curriculum in an Indigenous School
di: Jue Wang
Pubblicazione: (2025)
di: Jue Wang
Pubblicazione: (2025)
Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
di: Zhang, Huaxin, et al.
Pubblicazione: (2024)
TGMM: Combining Parse Tree with GPU for Scalable Multilingual and Multi-Granularity Code Clone Detection
di: Ye, Yuhang, et al.
Pubblicazione: (2024)
di: Ye, Yuhang, et al.
Pubblicazione: (2024)
VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
di: Yang, Xiangpeng, et al.
Pubblicazione: (2025)
Robust Learning of Multi-index Models via Iterative Subspace Approximation
di: Diakonikolas, Ilias, et al.
Pubblicazione: (2025)
di: Diakonikolas, Ilias, et al.
Pubblicazione: (2025)
How2Compress: Scalable and Efficient Edge Video Analytics via Adaptive Granular Video Compression
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
di: Wu, Yuheng, et al.
Pubblicazione: (2025)
Optimal Fixed-Price Mechanism with Signaling
di: Fan, Zhikang, et al.
Pubblicazione: (2024)
di: Fan, Zhikang, et al.
Pubblicazione: (2024)
Revenue Maximization Mechanisms for an Uninformed Mediator with Communication Abilities
di: Fan, Zhikang, et al.
Pubblicazione: (2024)
di: Fan, Zhikang, et al.
Pubblicazione: (2024)
Selling an Item through Persuasion
di: Fan, Zhikang, et al.
Pubblicazione: (2024)
di: Fan, Zhikang, et al.
Pubblicazione: (2024)
Multi-Focus Temporal Shifting for Precise Event Spotting in Sports Videos
di: Xu, Hao, et al.
Pubblicazione: (2025)
di: Xu, Hao, et al.
Pubblicazione: (2025)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
di: Tsigos, Konstantinos, et al.
Pubblicazione: (2024)
MG-TSD: Multi-Granularity Time Series Diffusion Models with Guided Learning Process
di: Fan, Xinyao, et al.
Pubblicazione: (2024)
di: Fan, Xinyao, et al.
Pubblicazione: (2024)
Modeling language contact with the Iterated Learning Model
di: Bullock, Seth, et al.
Pubblicazione: (2024)
di: Bullock, Seth, et al.
Pubblicazione: (2024)
Granular-ball Representation Learning for Deep CNN on Learning with Label Noise
di: Dai, Dawei, et al.
Pubblicazione: (2024)
di: Dai, Dawei, et al.
Pubblicazione: (2024)
Iterated Radical Expansions and Convergence
di: Finch, Steven
Pubblicazione: (2024)
di: Finch, Steven
Pubblicazione: (2024)
A Supervised Information Enhanced Multi-Granularity Contrastive Learning Framework for EEG Based Emotion Recognition
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Text-Guided Video Masked Autoencoder
di: Fan, David, et al.
Pubblicazione: (2024) -
NowYouSee Me: Context-Aware Automatic Audio Description
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024) -
Video Token Merging for Long-form Video Understanding
di: Lee, Seon-Ho, et al.
Pubblicazione: (2024) -
RefTok: Reference-Based Tokenization for Video Generation
di: Fan, Xiang, et al.
Pubblicazione: (2025) -
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)