A Transformer-based Multimodal Fusion Model for Efficient Crowd Counting Using Visual and Wireless Signals
Fuente:
arXiv
Guardado en:
| Autores principales: | Cui, Zhe, Li, Yuli, Tran, Le-Nam |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Bayesian Multi-Scale Neural Network for Crowd Counting
por: Sagar, Abhinav
Publicado: (2020)
por: Sagar, Abhinav
Publicado: (2020)
Semi-Supervised Crowd Counting from Unlabeled Data
por: Duan, Haoran, et al.
Publicado: (2021)
por: Duan, Haoran, et al.
Publicado: (2021)
Count2Density: Crowd Density Estimation without Location-level Annotations
por: Litrico, Mattia, et al.
Publicado: (2025)
por: Litrico, Mattia, et al.
Publicado: (2025)
LaVy: Vietnamese Multimodal Large Language Model
por: Tran, Chi, et al.
Publicado: (2024)
por: Tran, Chi, et al.
Publicado: (2024)
MTCNET: Multi-task Learning Paradigm for Crowd Count Estimation
por: Kumar, Abhay, et al.
Publicado: (2019)
por: Kumar, Abhay, et al.
Publicado: (2019)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
por: Tekin, Selim Furkan, et al.
Publicado: (2026)
COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark
por: Chintapatla, Ishant, et al.
Publicado: (2025)
por: Chintapatla, Ishant, et al.
Publicado: (2025)
Beyond the Permutation Symmetry of Transformers: The Role of Rotation for Model Fusion
por: Zhang, Binchi, et al.
Publicado: (2025)
por: Zhang, Binchi, et al.
Publicado: (2025)
Efficient Visual Transformer by Learnable Token Merging
por: Wang, Yancheng, et al.
Publicado: (2024)
por: Wang, Yancheng, et al.
Publicado: (2024)
DualSwinFusionSeg: Multimodal Martian Landslide Segmentation via Dual Swin Transformer with Multi-Scale Fusion and UNet++
por: Kabir, Shahriar, et al.
Publicado: (2026)
por: Kabir, Shahriar, et al.
Publicado: (2026)
KOPPA: Improving Prompt-based Continual Learning with Key-Query Orthogonal Projection and Prototype-based One-Versus-All
por: Tran, Quyen, et al.
Publicado: (2023)
por: Tran, Quyen, et al.
Publicado: (2023)
DashFusion: Dual-stream Alignment with Hierarchical Bottleneck Fusion for Multimodal Sentiment Analysis
por: Wen, Yuhua, et al.
Publicado: (2025)
por: Wen, Yuhua, et al.
Publicado: (2025)
Sampling Strategies based on Wisdom of Crowds for Amazon Deforestation Detection
por: Resende, Hugo, et al.
Publicado: (2024)
por: Resende, Hugo, et al.
Publicado: (2024)
Combining YOLO and Visual Rhythm for Vehicle Counting
por: Ribeiro, Victor Nascimento, et al.
Publicado: (2025)
por: Ribeiro, Victor Nascimento, et al.
Publicado: (2025)
Enhancing Visual Question Answering through Ranking-Based Hybrid Training and Multimodal Fusion
por: Chen, Peiyuan, et al.
Publicado: (2024)
por: Chen, Peiyuan, et al.
Publicado: (2024)
WriteViT: Handwritten Text Generation with Vision Transformer
por: Nam, Dang Hoai, et al.
Publicado: (2025)
por: Nam, Dang Hoai, et al.
Publicado: (2025)
Unveiling the Visual Counting Bottleneck in Vision-Language Models
por: Pang, Xingzhou, et al.
Publicado: (2026)
por: Pang, Xingzhou, et al.
Publicado: (2026)
Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models
por: Hou, Kuinan, et al.
Publicado: (2025)
por: Hou, Kuinan, et al.
Publicado: (2025)
Innovative Silicosis and Pneumonia Classification: Leveraging Graph Transformer Post-hoc Modeling and Ensemble Techniques
por: Bui, Bao Q., et al.
Publicado: (2024)
por: Bui, Bao Q., et al.
Publicado: (2024)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
por: Van-Dinh, Tue-Thu, et al.
Publicado: (2025)
por: Van-Dinh, Tue-Thu, et al.
Publicado: (2025)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
por: Zhang, Dingkun, et al.
Publicado: (2026)
por: Zhang, Dingkun, et al.
Publicado: (2026)
StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation
por: Li, Bingyu, et al.
Publicado: (2024)
por: Li, Bingyu, et al.
Publicado: (2024)
FrogDeepSDM: Improving Frog Counting and Occurrence Prediction Using Multimodal Data and Pseudo-Absence Imputation
por: Padubidri, Chirag, et al.
Publicado: (2025)
por: Padubidri, Chirag, et al.
Publicado: (2025)
Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models
por: Li, Xu, et al.
Publicado: (2024)
por: Li, Xu, et al.
Publicado: (2024)
Learning Multimodal Latent Generative Models with Energy-Based Prior
por: Yuan, Shiyu, et al.
Publicado: (2024)
por: Yuan, Shiyu, et al.
Publicado: (2024)
Transformer-Based Dual-Optical Attention Fusion Crowd Head Point Counting and Localization Network
por: Zhou, Fei, et al.
Publicado: (2025)
por: Zhou, Fei, et al.
Publicado: (2025)
Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation
por: Han, Boyu, et al.
Publicado: (2026)
por: Han, Boyu, et al.
Publicado: (2026)
Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts
por: Le, Minh, et al.
Publicado: (2025)
por: Le, Minh, et al.
Publicado: (2025)
Multimodal Reference Visual Grounding
por: Lu, Yangxiao, et al.
Publicado: (2025)
por: Lu, Yangxiao, et al.
Publicado: (2025)
CountFormer: Multi-View Crowd Counting Transformer
por: Mo, Hong, et al.
Publicado: (2024)
por: Mo, Hong, et al.
Publicado: (2024)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
por: Kuchibhotla, Hari Chandana, et al.
Publicado: (2025)
por: Kuchibhotla, Hari Chandana, et al.
Publicado: (2025)
Visual Prompting in Multimodal Large Language Models: A Survey
por: Wu, Junda, et al.
Publicado: (2024)
por: Wu, Junda, et al.
Publicado: (2024)
UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations
por: Mühlematter, Dominik J., et al.
Publicado: (2025)
por: Mühlematter, Dominik J., et al.
Publicado: (2025)
Beyond Simple Fusion: Adaptive Gated Fusion for Robust Multimodal Sentiment Analysis
por: Wu, Han, et al.
Publicado: (2025)
por: Wu, Han, et al.
Publicado: (2025)
UL-DD: A Multimodal Drowsiness Dataset Using Video, Biometric Signals, and Behavioral Data
por: Bodaghi, Morteza, et al.
Publicado: (2025)
por: Bodaghi, Morteza, et al.
Publicado: (2025)
Audio-Visual Compound Expression Recognition Method based on Late Modality Fusion and Rule-based Decision
por: Ryumina, Elena, et al.
Publicado: (2024)
por: Ryumina, Elena, et al.
Publicado: (2024)
Data-Efficient Multimodal Fusion on a Single GPU
por: Vouitsis, Noël, et al.
Publicado: (2023)
por: Vouitsis, Noël, et al.
Publicado: (2023)
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling
por: Tran, Minh-Tuan, et al.
Publicado: (2026)
por: Tran, Minh-Tuan, et al.
Publicado: (2026)
SViQA: A Unified Speech-Vision Multimodal Model for Textless Visual Question Answering
por: Li, Bingxin
Publicado: (2025)
por: Li, Bingxin
Publicado: (2025)
Scale, Don't Fine-tune: Guiding Multimodal LLMs for Efficient Visual Place Recognition at Test-Time
por: Cheng, Jintao, et al.
Publicado: (2025)
por: Cheng, Jintao, et al.
Publicado: (2025)
Ejemplares similares
-
Bayesian Multi-Scale Neural Network for Crowd Counting
por: Sagar, Abhinav
Publicado: (2020) -
Semi-Supervised Crowd Counting from Unlabeled Data
por: Duan, Haoran, et al.
Publicado: (2021) -
Count2Density: Crowd Density Estimation without Location-level Annotations
por: Litrico, Mattia, et al.
Publicado: (2025) -
LaVy: Vietnamese Multimodal Large Language Model
por: Tran, Chi, et al.
Publicado: (2024) -
MTCNET: Multi-task Learning Paradigm for Crowd Count Estimation
por: Kumar, Abhay, et al.
Publicado: (2019)