BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Ruyang, Li, Chen, Ge, Yixiao, Shan, Ying, Li, Thomas H., Li, Ge |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ST-LLM: Large Language Models Are Effective Temporal Learners
por: Liu, Ruyang, et al.
Publicado: (2024)
por: Liu, Ruyang, et al.
Publicado: (2024)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
por: Li, Yizhuo, et al.
Publicado: (2024)
por: Li, Yizhuo, et al.
Publicado: (2024)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
por: Pu, Junfu, et al.
Publicado: (2025)
por: Pu, Junfu, et al.
Publicado: (2025)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
por: Qiu, Lu, et al.
Publicado: (2025)
por: Qiu, Lu, et al.
Publicado: (2025)
PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance
por: Sun, Shangkun, et al.
Publicado: (2024)
por: Sun, Shangkun, et al.
Publicado: (2024)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
Flow4Agent: Long-form Video Understanding via Motion Prior from Optical Flow
por: Liu, Ruyang, et al.
Publicado: (2025)
por: Liu, Ruyang, et al.
Publicado: (2025)
Video Spatial Reasoning with Object-Centric 3D Rollout
por: Tang, Haoran, et al.
Publicado: (2025)
por: Tang, Haoran, et al.
Publicado: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
por: Li, Bohao, et al.
Publicado: (2024)
por: Li, Bohao, et al.
Publicado: (2024)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
por: Cheng, Cheng, et al.
Publicado: (2023)
por: Cheng, Cheng, et al.
Publicado: (2023)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
por: Chen, Yi, et al.
Publicado: (2024)
por: Chen, Yi, et al.
Publicado: (2024)
Aligning Latent Spaces with Flow Priors
por: Li, Yizhuo, et al.
Publicado: (2025)
por: Li, Yizhuo, et al.
Publicado: (2025)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
por: Chen, Yi, et al.
Publicado: (2025)
por: Chen, Yi, et al.
Publicado: (2025)
SEED-Story: Multimodal Long Story Generation with Large Language Model
por: Yang, Shuai, et al.
Publicado: (2024)
por: Yang, Shuai, et al.
Publicado: (2024)
ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
por: Ge, Yuying, et al.
Publicado: (2025)
por: Ge, Yuying, et al.
Publicado: (2025)
Generalizing Deepfake Video Detection with Plug-and-Play: Video-Level Blending and Spatiotemporal Adapter Tuning
por: Yan, Zhiyuan, et al.
Publicado: (2024)
por: Yan, Zhiyuan, et al.
Publicado: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
por: Cheng, Junhao, et al.
Publicado: (2025)
por: Cheng, Junhao, et al.
Publicado: (2025)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
por: Ge, Mingji, et al.
Publicado: (2026)
por: Ge, Mingji, et al.
Publicado: (2026)
Streaming Video Instruction Tuning
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
por: Qiu, Lu, et al.
Publicado: (2024)
por: Qiu, Lu, et al.
Publicado: (2024)
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
por: Ma, Shijie, et al.
Publicado: (2025)
por: Ma, Shijie, et al.
Publicado: (2025)
Hyperspectral Adapter for Object Tracking based on Hyperspectral Video
por: Gao, Long, et al.
Publicado: (2025)
por: Gao, Long, et al.
Publicado: (2025)
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024)
por: Ge, Yuying, et al.
Publicado: (2024)
Character Mixing for Video Generation
por: Liao, Tingting, et al.
Publicado: (2025)
por: Liao, Tingting, et al.
Publicado: (2025)
Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation
por: Li, Weijie, et al.
Publicado: (2024)
por: Li, Weijie, et al.
Publicado: (2024)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
por: Lin, Kuanwei, et al.
Publicado: (2026)
por: Lin, Kuanwei, et al.
Publicado: (2026)
VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding
por: Zhao, Henghao, et al.
Publicado: (2025)
por: Zhao, Henghao, et al.
Publicado: (2025)
VideoCuRL: Video Curriculum Reinforcement Learning with Orthogonal Difficulty Decomposition
por: Jin, Hongbo, et al.
Publicado: (2025)
por: Jin, Hongbo, et al.
Publicado: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
por: Ge, Mengying, et al.
Publicado: (2024)
por: Ge, Mengying, et al.
Publicado: (2024)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
por: Liu, Gongye, et al.
Publicado: (2023)
por: Liu, Gongye, et al.
Publicado: (2023)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
por: Chen, Yi, et al.
Publicado: (2023)
por: Chen, Yi, et al.
Publicado: (2023)
YOLO-World: Real-Time Open-Vocabulary Object Detection
por: Cheng, Tianheng, et al.
Publicado: (2024)
por: Cheng, Tianheng, et al.
Publicado: (2024)
Ejemplares similares
-
ST-LLM: Large Language Models Are Effective Temporal Learners
por: Liu, Ruyang, et al.
Publicado: (2024) -
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
por: Ge, Yuying, et al.
Publicado: (2024) -
RAP: Efficient Text-Video Retrieval with Sparse-and-Correlated Adapter
por: Cao, Meng, et al.
Publicado: (2024) -
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
por: Li, Yizhuo, et al.
Publicado: (2024) -
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
por: Pu, Junfu, et al.
Publicado: (2025)