Decoding Visual Neural Representations by Multimodal with Dynamic Balancing
Fuente:
arXiv
Guardado en:
| Autores principales: | sun, Kaili, Miao, Xingyu, Zhai, Bing, Duan, Haoran, Long, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CTNeRF: Cross-Time Transformer for Dynamic Neural Radiance Field from Monocular Video
por: Miao, Xingyu, et al.
Publicado: (2024)
por: Miao, Xingyu, et al.
Publicado: (2024)
Rethinking Score Distilling Sampling for 3D Editing and Generation
por: Miao, Xingyu, et al.
Publicado: (2025)
por: Miao, Xingyu, et al.
Publicado: (2025)
Laser: Efficient Language-Guided Segmentation in Neural Radiance Fields
por: Miao, Xingyu, et al.
Publicado: (2025)
por: Miao, Xingyu, et al.
Publicado: (2025)
Neural-MCRL: Neural Multimodal Contrastive Representation Learning for EEG-based Visual Decoding
por: Li, Yueyang, et al.
Publicado: (2024)
por: Li, Yueyang, et al.
Publicado: (2024)
vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs
por: Shao, Minye, et al.
Publicado: (2025)
por: Shao, Minye, et al.
Publicado: (2025)
Sentinel-Guided Zero-Shot Learning: A Collaborative Paradigm without Real Data Exposure
por: Wan, Fan, et al.
Publicado: (2024)
por: Wan, Fan, et al.
Publicado: (2024)
ConRF: Zero-shot Stylization of 3D Scenes with Conditioned Radiation Fields
por: Miao, Xingyu, et al.
Publicado: (2024)
por: Miao, Xingyu, et al.
Publicado: (2024)
M2StyleGS: Multi-Modality 3D Style Transfer with Gaussian Splatting
por: Miao, Xingyu, et al.
Publicado: (2026)
por: Miao, Xingyu, et al.
Publicado: (2026)
ExactDreamer: High-Fidelity Text-to-3D Content Creation via Exact Score Matching
por: Zhang, Yumin, et al.
Publicado: (2024)
por: Zhang, Yumin, et al.
Publicado: (2024)
Dreamer XL: Towards High-Resolution Text-to-3D Generation via Trajectory Score Matching
por: Miao, Xingyu, et al.
Publicado: (2024)
por: Miao, Xingyu, et al.
Publicado: (2024)
Exploring The Visual Feature Space for Multimodal Neural Decoding
por: Xia, Weihao, et al.
Publicado: (2025)
por: Xia, Weihao, et al.
Publicado: (2025)
Brain3D: EEG-to-3D Decoding of Visual Representations via Multimodal Reasoning
por: Balloni, Emanuele, et al.
Publicado: (2026)
por: Balloni, Emanuele, et al.
Publicado: (2026)
Conv-INR: Convolutional Implicit Neural Representation for Multimodal Visual Signals
por: Cai, Zhicheng
Publicado: (2024)
por: Cai, Zhicheng
Publicado: (2024)
Mitigating Hallucination in Visual-Language Models via Re-Balancing Contrastive Decoding
por: Liang, Xiaoyu, et al.
Publicado: (2024)
por: Liang, Xiaoyu, et al.
Publicado: (2024)
TRACE: Temporally Reliable Anatomically-Conditioned 3D CT Generation with Enhanced Efficiency
por: Shao, Minye, et al.
Publicado: (2025)
por: Shao, Minye, et al.
Publicado: (2025)
Improved Implicit Neural Representation with Fourier Reparameterized Training
por: Shi, Kexuan, et al.
Publicado: (2024)
por: Shi, Kexuan, et al.
Publicado: (2024)
Revisiting Multi-Task Visual Representation Learning
por: Di, Shangzhe, et al.
Publicado: (2026)
por: Di, Shangzhe, et al.
Publicado: (2026)
Neural Clustering based Visual Representation Learning
por: Chen, Guikun, et al.
Publicado: (2024)
por: Chen, Guikun, et al.
Publicado: (2024)
TrajVG: 3D Trajectory-Coupled Visual Geometry Learning
por: Miao, Xingyu, et al.
Publicado: (2026)
por: Miao, Xingyu, et al.
Publicado: (2026)
Attention in Diffusion Model: A Survey
por: Hua, Litao, et al.
Publicado: (2025)
por: Hua, Litao, et al.
Publicado: (2025)
FMDConv: Fast Multi-Attention Dynamic Convolution via Speed-Accuracy Trade-off
por: Zhang, Tianyu, et al.
Publicado: (2025)
por: Zhang, Tianyu, et al.
Publicado: (2025)
Efficient Unsupervised Visual Representation Learning with Explicit Cluster Balancing
por: Metaxas, Ioannis Maniadis, et al.
Publicado: (2024)
por: Metaxas, Ioannis Maniadis, et al.
Publicado: (2024)
Fewer Tokens, Greater Scaling: Self-Adaptive Visual Bases for Efficient and Expansive Representation Learning
por: Young, Shawn, et al.
Publicado: (2025)
por: Young, Shawn, et al.
Publicado: (2025)
Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting
por: Miao, Xingyu, et al.
Publicado: (2025)
por: Miao, Xingyu, et al.
Publicado: (2025)
Multimodal Mamba: Decoder-only Multimodal State Space Model via Quadratic to Linear Distillation
por: Liao, Bencheng, et al.
Publicado: (2025)
por: Liao, Bencheng, et al.
Publicado: (2025)
LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs
por: Lou, Haoran, et al.
Publicado: (2025)
por: Lou, Haoran, et al.
Publicado: (2025)
Structure-Preserving Patch Decoding for Efficient Neural Video Representation
por: Hayami, Taiga, et al.
Publicado: (2025)
por: Hayami, Taiga, et al.
Publicado: (2025)
SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning
por: Yang, Xiao, et al.
Publicado: (2026)
por: Yang, Xiao, et al.
Publicado: (2026)
Rethinking Brain Tumor Segmentation from the Frequency Domain Perspective
por: Shao, Minye, et al.
Publicado: (2025)
por: Shao, Minye, et al.
Publicado: (2025)
Simple Models, Rich Representations: Visual Decoding from Primate Intracortical Neural Signals
por: Ciferri, Matteo, et al.
Publicado: (2026)
por: Ciferri, Matteo, et al.
Publicado: (2026)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
por: Leng, Sicong, et al.
Publicado: (2024)
por: Leng, Sicong, et al.
Publicado: (2024)
Visual Neural Decoding via Improved Visual-EEG Semantic Consistency
por: Chen, Hongzhou, et al.
Publicado: (2024)
por: Chen, Hongzhou, et al.
Publicado: (2024)
VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection
por: Deng, Huilin, et al.
Publicado: (2024)
por: Deng, Huilin, et al.
Publicado: (2024)
Asynchronous Multimodal Video Sequence Fusion via Learning Modality-Exclusive and -Agnostic Representations
por: Yang, Dingkang, et al.
Publicado: (2024)
por: Yang, Dingkang, et al.
Publicado: (2024)
From Frames to Sequences: Temporally Consistent Human-Centric Dense Prediction
por: Miao, Xingyu, et al.
Publicado: (2026)
por: Miao, Xingyu, et al.
Publicado: (2026)
ViEEG: Hierarchical Visual Neural Representation for EEG Brain Decoding
por: Liu, Minxu, et al.
Publicado: (2025)
por: Liu, Minxu, et al.
Publicado: (2025)
REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding
por: Tai, Yan, et al.
Publicado: (2025)
por: Tai, Yan, et al.
Publicado: (2025)
CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models
por: Li, Junhao, et al.
Publicado: (2026)
por: Li, Junhao, et al.
Publicado: (2026)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025)
por: Wu, Size, et al.
Publicado: (2025)
Visual Representation Alignment for Multimodal Large Language Models
por: Yoon, Heeji, et al.
Publicado: (2025)
por: Yoon, Heeji, et al.
Publicado: (2025)
Ejemplares similares
-
CTNeRF: Cross-Time Transformer for Dynamic Neural Radiance Field from Monocular Video
por: Miao, Xingyu, et al.
Publicado: (2024) -
Rethinking Score Distilling Sampling for 3D Editing and Generation
por: Miao, Xingyu, et al.
Publicado: (2025) -
Laser: Efficient Language-Guided Segmentation in Neural Radiance Fields
por: Miao, Xingyu, et al.
Publicado: (2025) -
Neural-MCRL: Neural Multimodal Contrastive Representation Learning for EEG-based Visual Decoding
por: Li, Yueyang, et al.
Publicado: (2024) -
vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs
por: Shao, Minye, et al.
Publicado: (2025)