Enregistré dans:
| Auteurs principaux: | Huang, Zhihao, Qiu, Xi, Ma, Yukuo, Zhou, Yifu, Chen, Junjie, Zhang, Hongyuan, Zhang, Chi, Li, Xuelong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2503.07076 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video
par: Moore, Alexander, et autres
Publié: (2025)
par: Moore, Alexander, et autres
Publié: (2025)
CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models
par: Yao, Dongyu, et autres
Publié: (2024)
par: Yao, Dongyu, et autres
Publié: (2024)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
GLL: A Differentiable Graph Learning Layer for Neural Networks
par: Brown, Jason, et autres
Publié: (2024)
par: Brown, Jason, et autres
Publié: (2024)
Ultrahigh-Q chiral resonances empowered by multi-head attention deep learning
par: Zhang, Cong, et autres
Publié: (2025)
par: Zhang, Cong, et autres
Publié: (2025)
Cooperative Perception: A Resource-Efficient Framework for Multi-Drone 3D Scene Reconstruction Using Federated Diffusion and NeRF
par: Pourmandi, Massoud
Publié: (2025)
par: Pourmandi, Massoud
Publié: (2025)
Predictive Modeling of Maritime Radar Data Using Transformer Architecture
par: Qesaraku, Bjorna, et autres
Publié: (2025)
par: Qesaraku, Bjorna, et autres
Publié: (2025)
When Does Global Attention Help? A Unified Empirical Study on Atomistic Graph Learning
par: Chowdhury, Arindam, et autres
Publié: (2025)
par: Chowdhury, Arindam, et autres
Publié: (2025)
Short-Window Sliding Learning for Real-Time Violence Detection via LLM-based Auto-Labeling
par: Jung, Seoik, et autres
Publié: (2025)
par: Jung, Seoik, et autres
Publié: (2025)
To Whom are You Talking? A Deep Learning Model to Endow Social Robots with Addressee Estimation Skills
par: Mazzola, Carlo, et autres
Publié: (2023)
par: Mazzola, Carlo, et autres
Publié: (2023)
An Analysis of Layer-Freezing Strategies for Enhanced Transfer Learning in YOLO Architectures
par: Dobrzycki, Andrzej D., et autres
Publié: (2025)
par: Dobrzycki, Andrzej D., et autres
Publié: (2025)
Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models
par: Menon, Anjali R., et autres
Publié: (2025)
par: Menon, Anjali R., et autres
Publié: (2025)
Balanced conic rectified flow
par: Kim, Shin Seong, et autres
Publié: (2025)
par: Kim, Shin Seong, et autres
Publié: (2025)
Self-Attention And Beyond the Infinite: Towards Linear Transformers with Infinite Self-Attention
par: Roffo, Giorgio, et autres
Publié: (2026)
par: Roffo, Giorgio, et autres
Publié: (2026)
IDOL: Instant Photorealistic 3D Human Creation from a Single Image
par: Zhuang, Yiyu, et autres
Publié: (2024)
par: Zhuang, Yiyu, et autres
Publié: (2024)
MRI Brain Tumor Detection with Computer Vision
par: Krolik, Jack, et autres
Publié: (2025)
par: Krolik, Jack, et autres
Publié: (2025)
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
par: Liao, Xinyao, et autres
Publié: (2025)
par: Liao, Xinyao, et autres
Publié: (2025)
Exploring specialization and sensitivity of convolutional neural networks in the context of simultaneous image augmentations
par: Kharyuk, Pavel, et autres
Publié: (2025)
par: Kharyuk, Pavel, et autres
Publié: (2025)
Platonic Representations in the Human Brain: Unsupervised Recovery of Universal Geometry
par: Marcos-Manchón, Pablo, et autres
Publié: (2026)
par: Marcos-Manchón, Pablo, et autres
Publié: (2026)
Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning
par: Sharma, Aditya, et autres
Publié: (2025)
par: Sharma, Aditya, et autres
Publié: (2025)
Spectral Integrated Gradients for Coarse-to-Fine Feature Attribution
par: Kim, Soyeon, et autres
Publié: (2026)
par: Kim, Soyeon, et autres
Publié: (2026)
Manifold-Aligned Guided Integrated Gradients for Reliable Feature Attribution
par: Kim, Soyeon, et autres
Publié: (2026)
par: Kim, Soyeon, et autres
Publié: (2026)
Application of Sensitivity Analysis Methods for Studying Neural Network Models
par: Miao, Jiaxuan, et autres
Publié: (2025)
par: Miao, Jiaxuan, et autres
Publié: (2025)
Method of UAV Inspection of Photovoltaic Modules Using Thermal and RGB Data Fusion
par: Lysyi, Andrii, et autres
Publié: (2025)
par: Lysyi, Andrii, et autres
Publié: (2025)
Multimodal Generative AI for Story Point Estimation in Software Development
par: Islam, Mohammad Rubyet, et autres
Publié: (2025)
par: Islam, Mohammad Rubyet, et autres
Publié: (2025)
Rethinking Visual Intelligence: Insights from Video Pretraining
par: Acuaviva, Pablo, et autres
Publié: (2025)
par: Acuaviva, Pablo, et autres
Publié: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024)
par: Ma, Yueen, et autres
Publié: (2024)
Contrastive Consolidation of Top-Down Modulations Achieves Sparsely Supervised Continual Learning
par: Tran, Viet Anh Khoa, et autres
Publié: (2025)
par: Tran, Viet Anh Khoa, et autres
Publié: (2025)
Tricks and Plug-ins for Gradient Boosting in Image Classification
par: Fang, Biyi, et autres
Publié: (2025)
par: Fang, Biyi, et autres
Publié: (2025)
ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval
par: Syed, Shahram Najam, et autres
Publié: (2025)
par: Syed, Shahram Najam, et autres
Publié: (2025)
Multi-Scale Graph Learning for Anti-Sparse Downscaling
par: Fan, Yingda, et autres
Publié: (2025)
par: Fan, Yingda, et autres
Publié: (2025)
Low Dose CT for Stroke Diagnosis: A Dual Pipeline Deep Learning Framework for Portable Neuroimaging
par: Ghosal, Rhea, et autres
Publié: (2026)
par: Ghosal, Rhea, et autres
Publié: (2026)
Sat-JEPA-Diff: Bridging Self-Supervised Learning and Generative Diffusion for Remote Sensing
par: Komurcu, Kursat, et autres
Publié: (2026)
par: Komurcu, Kursat, et autres
Publié: (2026)
OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment
par: Zhao, Weiyi, et autres
Publié: (2025)
par: Zhao, Weiyi, et autres
Publié: (2025)
Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur
par: Meziani, Yani
Publié: (2026)
par: Meziani, Yani
Publié: (2026)
Task-Aligned Self-Supervised Learning for Medical Image Analysis: A Systematic Review and Practical Design Guidelines
par: Wimalasiri, Chathura
Publié: (2026)
par: Wimalasiri, Chathura
Publié: (2026)
Robust Noise Attenuation via Adaptive Pooling of Transformer Outputs
par: Brothers, Greyson
Publié: (2025)
par: Brothers, Greyson
Publié: (2025)
Enhancing Low-Altitude Airspace Security: MLLM-Enabled UAV Intent Recognition
par: Lei, Guangyu, et autres
Publié: (2025)
par: Lei, Guangyu, et autres
Publié: (2025)
APT: Adaptive Personalized Training for Diffusion Models with Limited Data
par: Chae, JungWoo, et autres
Publié: (2025)
par: Chae, JungWoo, et autres
Publié: (2025)
Documents similaires
-
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025) -
Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video
par: Moore, Alexander, et autres
Publié: (2025) -
CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models
par: Yao, Dongyu, et autres
Publié: (2024) -
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025) -
GLL: A Differentiable Graph Learning Layer for Neural Networks
par: Brown, Jason, et autres
Publié: (2024)