LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chang, Tzu-Tao, Venkataraman, Shivaram |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Eva: Cost-Efficient Cloud-Based Cluster Scheduling
par: Chang, Tzu-Tao, et autres
Publié: (2025)
par: Chang, Tzu-Tao, et autres
Publié: (2025)
A Scene-aware Models Adaptation Scheme for Cross-scene Online Inference on Mobile Devices
par: Li, Yunzhe, et autres
Publié: (2024)
par: Li, Yunzhe, et autres
Publié: (2024)
A Scalable Distributed Framework for Multimodal GigaVoxel Image Registration
par: Jena, Rohit, et autres
Publié: (2025)
par: Jena, Rohit, et autres
Publié: (2025)
Enabling Cross-Camera Collaboration for Video Analytics on Distributed Smart Cameras
par: Min, Chulhong, et autres
Publié: (2024)
par: Min, Chulhong, et autres
Publié: (2024)
Distributed Hybrid Parallelism for Large Language Models: Comparative Study and System Design Guide
par: Amer, Hossam, et autres
Publié: (2026)
par: Amer, Hossam, et autres
Publié: (2026)
Improving Zero-shot ADL Recognition with Large Language Models through Event-based Context and Confidence
par: Fiori, Michele, et autres
Publié: (2026)
par: Fiori, Michele, et autres
Publié: (2026)
Tesserae: Scalable Placement Policies for Deep Learning Workloads
par: Bian, Song, et autres
Publié: (2025)
par: Bian, Song, et autres
Publié: (2025)
OpenFLAME: Federated Visual Positioning System to Enable Large-Scale Augmented Reality Applications
par: Bharadwaj, Sagar, et autres
Publié: (2025)
par: Bharadwaj, Sagar, et autres
Publié: (2025)
Efficiently Serving Large Multimodal Models Using EPD Disaggregation
par: Singh, Gursimran, et autres
Publié: (2024)
par: Singh, Gursimran, et autres
Publié: (2024)
LAECIPS: Large Vision Model Assisted Adaptive Edge-Cloud Collaboration for IoT-based Embodied Intelligence System
par: Hu, Shijing, et autres
Publié: (2024)
par: Hu, Shijing, et autres
Publié: (2024)
Flexible Communication for Optimal Distributed Learning over Unpredictable Networks
par: Tyagi, Sahil, et autres
Publié: (2023)
par: Tyagi, Sahil, et autres
Publié: (2023)
ARIA: On the Interaction Between Architectures, Initialization and Aggregation Methods for Federated Visual Classification
par: Siomos, Vasilis, et autres
Publié: (2023)
par: Siomos, Vasilis, et autres
Publié: (2023)
LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
par: Chen, Yukang, et autres
Publié: (2026)
par: Chen, Yukang, et autres
Publié: (2026)
Self-Organizing Edge Computing Distribution Framework for Visual SLAM
par: Kalliola, Jussi, et autres
Publié: (2025)
par: Kalliola, Jussi, et autres
Publié: (2025)
Real-Time Video Generation with Pyramid Attention Broadcast
par: Zhao, Xuanlei, et autres
Publié: (2024)
par: Zhao, Xuanlei, et autres
Publié: (2024)
Distributed LLMs and Multimodal Large Language Models: A Survey on Advances, Challenges, and Future Directions
par: Amini, Hadi, et autres
Publié: (2025)
par: Amini, Hadi, et autres
Publié: (2025)
Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU
par: Ning, Zhenyu, et autres
Publié: (2024)
par: Ning, Zhenyu, et autres
Publié: (2024)
SYMPHONY: Improving Memory Management for LLM Inference Workloads
par: Agarwal, Saurabh, et autres
Publié: (2024)
par: Agarwal, Saurabh, et autres
Publié: (2024)
Cross-architecture universal feature coding via distribution alignment
par: Gao, Changsheng, et autres
Publié: (2025)
par: Gao, Changsheng, et autres
Publié: (2025)
Distributed Deep Learning for Medical Image Denoising with Data Obfuscation
par: Adebayo, Sulaimon Oyeniyi, et autres
Publié: (2025)
par: Adebayo, Sulaimon Oyeniyi, et autres
Publié: (2025)
Skewness-Guided Pruning of Multimodal Swin Transformers for Federated Skin Lesion Classification on Edge Devices
par: Paxton, Kuniko, et autres
Publié: (2025)
par: Paxton, Kuniko, et autres
Publié: (2025)
Federated Unsupervised Visual Representation Learning via Exploiting General Content and Personal Style
par: Yang, Yuewei, et autres
Publié: (2022)
par: Yang, Yuewei, et autres
Publié: (2022)
CloudEye: A New Paradigm of Video Analysis System for Mobile Visual Scenarios
par: Cui, Huan, et autres
Publié: (2024)
par: Cui, Huan, et autres
Publié: (2024)
SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs
par: Yang, Jiacheng, et autres
Publié: (2026)
par: Yang, Jiacheng, et autres
Publié: (2026)
Distributed Radiance Fields for Edge Video Compression and Metaverse Integration in Autonomous Driving
par: Šlapak, Eugen, et autres
Publié: (2024)
par: Šlapak, Eugen, et autres
Publié: (2024)
SlimEdge: Performance and Device Aware Distributed DNN Deployment on Resource-Constrained Edge Hardware
par: Kumar, Mahadev Sunil, et autres
Publié: (2025)
par: Kumar, Mahadev Sunil, et autres
Publié: (2025)
PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling
par: Wang, Sijie, et autres
Publié: (2025)
par: Wang, Sijie, et autres
Publié: (2025)
Radiant: Large-scale 3D Gaussian Rendering based on Hierarchical Framework
par: Peng, Haosong, et autres
Publié: (2024)
par: Peng, Haosong, et autres
Publié: (2024)
DSV: Exploiting Dynamic Sparsity to Accelerate Large-Scale Video DiT Training
par: Tan, Xin, et autres
Publié: (2025)
par: Tan, Xin, et autres
Publié: (2025)
Fed-EC: Bandwidth-Efficient Clustering-Based Federated Learning For Autonomous Visual Robot Navigation
par: Gummadi, Shreya, et autres
Publié: (2024)
par: Gummadi, Shreya, et autres
Publié: (2024)
Déjà Vu: Efficient Video-Language Query Engine with Learning-based Inter-Frame Computation Reuse
par: Hwang, Jinwoo, et autres
Publié: (2025)
par: Hwang, Jinwoo, et autres
Publié: (2025)
Partially Conditioned Patch Parallelism for Accelerated Diffusion Model Inference
par: Zhang, XiuYu, et autres
Publié: (2024)
par: Zhang, XiuYu, et autres
Publié: (2024)
Personalized Federated Fine-Tuning of Vision Foundation Models for Healthcare
par: Tupper, Adam, et autres
Publié: (2025)
par: Tupper, Adam, et autres
Publié: (2025)
ECORE: Energy-Conscious Optimized Routing for Deep Learning Models at the Edge
par: Alqahtani, Daghash K., et autres
Publié: (2025)
par: Alqahtani, Daghash K., et autres
Publié: (2025)
FedVSR: Towards Model-Agnostic Federated Learning in Video Super-Resolution
par: Dehaghi, Ali Mollaahmadi, et autres
Publié: (2025)
par: Dehaghi, Ali Mollaahmadi, et autres
Publié: (2025)
SemanticNN: Compressive and Error-Resilient Semantic Offloading for Extremely Weak Devices
par: Huang, Jiaming, et autres
Publié: (2025)
par: Huang, Jiaming, et autres
Publié: (2025)
GroupNL: Low-Resource and Robust CNN Design over Cloud and Device
par: Ding, Chuntao, et autres
Publié: (2025)
par: Ding, Chuntao, et autres
Publié: (2025)
Task-Agnostic Federated Learning
par: Yao, Zhengtao, et autres
Publié: (2024)
par: Yao, Zhengtao, et autres
Publié: (2024)
RE-POSE: Synergizing Reinforcement Learning-Based Partitioning and Offloading for Edge Object Detection
par: Shi, Jianrui, et autres
Publié: (2025)
par: Shi, Jianrui, et autres
Publié: (2025)
PointSplit: Towards On-device 3D Object Detection with Heterogeneous Low-power Accelerators
par: Park, Keondo, et autres
Publié: (2025)
par: Park, Keondo, et autres
Publié: (2025)
Documents similaires
-
Eva: Cost-Efficient Cloud-Based Cluster Scheduling
par: Chang, Tzu-Tao, et autres
Publié: (2025) -
A Scene-aware Models Adaptation Scheme for Cross-scene Online Inference on Mobile Devices
par: Li, Yunzhe, et autres
Publié: (2024) -
A Scalable Distributed Framework for Multimodal GigaVoxel Image Registration
par: Jena, Rohit, et autres
Publié: (2025) -
Enabling Cross-Camera Collaboration for Video Analytics on Distributed Smart Cameras
par: Min, Chulhong, et autres
Publié: (2024) -
Distributed Hybrid Parallelism for Large Language Models: Comparative Study and System Design Guide
par: Amer, Hossam, et autres
Publié: (2026)