Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Chung, Hyungjin, Nam, Hyelin, Kim, Jiyeon, Go, Hyojun, Park, Byeongjun, Kim, Junho, Lee, Joonseok, Ha, Seongsu, Kim, Byung-Hoon |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Generating Human Motion Videos using a Cascaded Text-to-Video Framework
di: Nam, Hyelin, et al.
Pubblicazione: (2025)
di: Nam, Hyelin, et al.
Pubblicazione: (2025)
VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling
di: Go, Hyojun, et al.
Pubblicazione: (2025)
di: Go, Hyojun, et al.
Pubblicazione: (2025)
SteerX: Creating Any Camera-Free 3D and 4D Scenes with Geometric Steering
di: Park, Byeongjun, et al.
Pubblicazione: (2025)
di: Park, Byeongjun, et al.
Pubblicazione: (2025)
ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
di: Park, Byeongjun, et al.
Pubblicazione: (2025)
di: Park, Byeongjun, et al.
Pubblicazione: (2025)
CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models
di: Kim, Junho, et al.
Pubblicazione: (2024)
di: Kim, Junho, et al.
Pubblicazione: (2024)
Bridging Implicit and Explicit Geometric Transformation for Single-Image View Synthesis
di: Park, Byeongjun, et al.
Pubblicazione: (2022)
di: Park, Byeongjun, et al.
Pubblicazione: (2022)
Scalable Frame Sampling for Video Classification: A Semi-Optimal Policy Approach with Reduced Search Space
di: Lee, Junho, et al.
Pubblicazione: (2024)
di: Lee, Junho, et al.
Pubblicazione: (2024)
Finding NeMo: Negative-mined Mosaic Augmentation for Referring Image Segmentation
di: Ha, Seongsu, et al.
Pubblicazione: (2024)
di: Ha, Seongsu, et al.
Pubblicazione: (2024)
Denoising Task Routing for Diffusion Models
di: Park, Byeongjun, et al.
Pubblicazione: (2023)
di: Park, Byeongjun, et al.
Pubblicazione: (2023)
Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs
di: Kim, Minji, et al.
Pubblicazione: (2025)
di: Kim, Minji, et al.
Pubblicazione: (2025)
CFG++: Manifold-constrained Classifier Free Guidance for Diffusion Models
di: Chung, Hyungjin, et al.
Pubblicazione: (2024)
di: Chung, Hyungjin, et al.
Pubblicazione: (2024)
Diffusion Model Patching via Mixture-of-Prompts
di: Ham, Seokil, et al.
Pubblicazione: (2024)
di: Ham, Seokil, et al.
Pubblicazione: (2024)
Switch Diffusion Transformer: Synergizing Denoising Tasks with Sparse Mixture-of-Experts
di: Park, Byeongjun, et al.
Pubblicazione: (2024)
di: Park, Byeongjun, et al.
Pubblicazione: (2024)
SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting Synthesis
di: Go, Hyojun, et al.
Pubblicazione: (2024)
di: Go, Hyojun, et al.
Pubblicazione: (2024)
Optical-Flow Guided Prompt Optimization for Coherent Video Generation
di: Nam, Hyelin, et al.
Pubblicazione: (2024)
di: Nam, Hyelin, et al.
Pubblicazione: (2024)
Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs
di: Oh, Gyutaek, et al.
Pubblicazione: (2025)
di: Oh, Gyutaek, et al.
Pubblicazione: (2025)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
di: Zhang, Yulin, et al.
Pubblicazione: (2026)
di: Zhang, Yulin, et al.
Pubblicazione: (2026)
Is There a Better Source Distribution than Gaussian? Exploring Source Distributions for Image Flow Matching
di: Lee, Junho, et al.
Pubblicazione: (2025)
di: Lee, Junho, et al.
Pubblicazione: (2025)
Geometry-Aware Image Flow Matching
di: Lee, Junho, et al.
Pubblicazione: (2026)
di: Lee, Junho, et al.
Pubblicazione: (2026)
Look Every Frame All at Once: Video-Ma$^2$mba for Efficient Long-form Video Understanding with Multi-Axis Gradient Checkpointing
di: Lee, Hosu, et al.
Pubblicazione: (2024)
di: Lee, Hosu, et al.
Pubblicazione: (2024)
TWLV-I: Analysis and Insights from Holistic Evaluation on Video Foundation Models
di: Lee, Hyeongmin, et al.
Pubblicazione: (2024)
di: Lee, Hyeongmin, et al.
Pubblicazione: (2024)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
di: Qin, Jialong, et al.
Pubblicazione: (2025)
di: Qin, Jialong, et al.
Pubblicazione: (2025)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
di: Guan, Yiran, et al.
Pubblicazione: (2026)
di: Guan, Yiran, et al.
Pubblicazione: (2026)
Hybrid Semantic-Complementary Transmission for High-Fidelity Image Reconstruction
di: Nam, Hyelin, et al.
Pubblicazione: (2025)
di: Nam, Hyelin, et al.
Pubblicazione: (2025)
Geometry-Guided Camera Motion Understanding in VideoLLMs
di: Feng, Haoan, et al.
Pubblicazione: (2026)
di: Feng, Haoan, et al.
Pubblicazione: (2026)
SummDiff: Generative Modeling of Video Summarization with Diffusion
di: Kim, Kwanseok, et al.
Pubblicazione: (2025)
di: Kim, Kwanseok, et al.
Pubblicazione: (2025)
A Foundational Brain Dynamics Model via Stochastic Optimal Control
di: Park, Joonhyeong, et al.
Pubblicazione: (2025)
di: Park, Joonhyeong, et al.
Pubblicazione: (2025)
Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding
di: Chatterjee, Dibyadip, et al.
Pubblicazione: (2025)
di: Chatterjee, Dibyadip, et al.
Pubblicazione: (2025)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
di: Li, Chenglin, et al.
Pubblicazione: (2026)
di: Li, Chenglin, et al.
Pubblicazione: (2026)
The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective
di: Kim, Jiin, et al.
Pubblicazione: (2025)
di: Kim, Jiin, et al.
Pubblicazione: (2025)
Isometric Representation Learning for Disentangled Latent Space of Diffusion Models
di: Hahm, Jaehoon, et al.
Pubblicazione: (2024)
di: Hahm, Jaehoon, et al.
Pubblicazione: (2024)
Let There Be Sound: Reconstructing High Quality Speech from Silent Videos
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
di: Kim, Ji-Hoon, et al.
Pubblicazione: (2023)
LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
di: Kim, Jihwan, et al.
Pubblicazione: (2026)
Lost in Time: A New Temporal Benchmark for VideoLLMs
di: Cores, Daniel, et al.
Pubblicazione: (2024)
di: Cores, Daniel, et al.
Pubblicazione: (2024)
Deep QP Safety Filter: Model-free Learning for Reachability-based Safety Filter
di: Kim, Byeongjun, et al.
Pubblicazione: (2026)
di: Kim, Byeongjun, et al.
Pubblicazione: (2026)
In‐Memory Euclidean Distance Computation in a Stacked Memristor Crossbar for Hardware Self‐Organizing Maps
di: Jinwoo Park, et al.
Pubblicazione: (2026)
di: Jinwoo Park, et al.
Pubblicazione: (2026)
Denoising Task Difficulty-based Curriculum for Training Diffusion Models
di: Kim, Jin-Young, et al.
Pubblicazione: (2024)
di: Kim, Jin-Young, et al.
Pubblicazione: (2024)
SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis
di: Kim, Junho, et al.
Pubblicazione: (2024)
di: Kim, Junho, et al.
Pubblicazione: (2024)
Preserve and Personalize: Personalized Text-to-Image Diffusion Models without Distributional Drift
di: Kim, Gihoon, et al.
Pubblicazione: (2025)
di: Kim, Gihoon, et al.
Pubblicazione: (2025)
TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
di: Kim, Sumin, et al.
Pubblicazione: (2026)
di: Kim, Sumin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Generating Human Motion Videos using a Cascaded Text-to-Video Framework
di: Nam, Hyelin, et al.
Pubblicazione: (2025) -
VideoRFSplat: Direct Scene-Level Text-to-3D Gaussian Splatting Generation with Flexible Pose and Multi-View Joint Modeling
di: Go, Hyojun, et al.
Pubblicazione: (2025) -
SteerX: Creating Any Camera-Free 3D and 4D Scenes with Geometric Steering
di: Park, Byeongjun, et al.
Pubblicazione: (2025) -
ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding
di: Park, Byeongjun, et al.
Pubblicazione: (2025) -
CapeLLM: Support-Free Category-Agnostic Pose Estimation with Multimodal Large Language Models
di: Kim, Junho, et al.
Pubblicazione: (2024)