SaFeR-VLM: Toward Safety-aware Fine-grained Reasoning in Multimodal Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yi, Huahui, Wang, Kun, Li, Qiankun, Yu, Miao, Lin, Liang, Xi, Gongli, Wu, Hao, Hu, Xuming, Li, Kang, Liu, Yang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety
by: Xu, Zixuan, et al.
Published: (2026)
by: Xu, Zixuan, et al.
Published: (2026)
SaFeR: Safety-Critical Scenario Generation for Autonomous Driving Test via Feasibility-Constrained Token Resampling
by: Cui, Jinlong, et al.
Published: (2026)
by: Cui, Jinlong, et al.
Published: (2026)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
by: Xi, Gongli, et al.
Published: (2026)
by: Xi, Gongli, et al.
Published: (2026)
Large Vision-Language Models Get Lost in Attention
by: Xi, Gongli, et al.
Published: (2026)
by: Xi, Gongli, et al.
Published: (2026)
Unified Modeling Enhanced Multimodal Learning for Precision Neuro-Oncology
by: Yi, Huahui, et al.
Published: (2024)
by: Yi, Huahui, et al.
Published: (2024)
PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality
by: Li, Nanxi, et al.
Published: (2025)
by: Li, Nanxi, et al.
Published: (2025)
Multimodal Fine-grained Reasoning for Post Quality Evaluation
by: Guo, Xiaoxu, et al.
Published: (2025)
by: Guo, Xiaoxu, et al.
Published: (2025)
NaturalVLM: Leveraging Fine-grained Natural Language for Affordance-Guided Visual Manipulation
by: Xu, Ran, et al.
Published: (2024)
by: Xu, Ran, et al.
Published: (2024)
M$^2$IV: Towards Efficient and Fine-grained Multimodal In-Context Learning via Representation Engineering
by: Li, Yanshu, et al.
Published: (2025)
by: Li, Yanshu, et al.
Published: (2025)
RareAlert: Aligning heterogeneous large language model reasoning for early rare disease risk screening
by: Chen, Xi, et al.
Published: (2026)
by: Chen, Xi, et al.
Published: (2026)
ADVEDM:Fine-grained Adversarial Attack against VLM-based Embodied Agents
by: Wang, Yichen, et al.
Published: (2025)
by: Wang, Yichen, et al.
Published: (2025)
Verifiable Cloud‐Assisted Multi‐Party Private Set Intersection Cardinality
by: Gongli Li, et al.
Published: (2025)
by: Gongli Li, et al.
Published: (2025)
Improving Medical Visual Reinforcement Fine-Tuning via Perception and Reasoning Augmentation
by: Yang, Guangjing, et al.
Published: (2026)
by: Yang, Guangjing, et al.
Published: (2026)
EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs
by: Lin, Liang, et al.
Published: (2026)
by: Lin, Liang, et al.
Published: (2026)
2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA
by: Wang, Zhiyu, et al.
Published: (2026)
by: Wang, Zhiyu, et al.
Published: (2026)
Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning
by: Zhang, Di, et al.
Published: (2024)
by: Zhang, Di, et al.
Published: (2024)
Fetal Therapy for Severe Drug‐Resisted Tachyarrhythmia With Progressive Hydrops by Fetoscopic Transesophageal Pacing: A Successful Attempt in Single Chinese Fetal Medicine Center
by: Hao Wang, et al.
Published: (2025)
by: Hao Wang, et al.
Published: (2025)
MA-Bench: Towards Fine-grained Micro-Action Understanding
by: Li, Kun, et al.
Published: (2026)
by: Li, Kun, et al.
Published: (2026)
CFSafety: Comprehensive Fine-grained Safety Assessment for LLMs
by: Liu, Zhihao, et al.
Published: (2024)
by: Liu, Zhihao, et al.
Published: (2024)
Safety is Not Only About Refusal: Reasoning-Enhanced Fine-tuning for Interpretable LLM Safety
by: Zhang, Yuyou, et al.
Published: (2025)
by: Zhang, Yuyou, et al.
Published: (2025)
Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
by: Ning, Shan, et al.
Published: (2026)
by: Ning, Shan, et al.
Published: (2026)
SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition
by: Yang, Jingxiao, et al.
Published: (2026)
by: Yang, Jingxiao, et al.
Published: (2026)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
by: Yu, Yongcan, et al.
Published: (2025)
by: Yu, Yongcan, et al.
Published: (2025)
FLAIR: VLM with Fine-grained Language-informed Image Representations
by: Xiao, Rui, et al.
Published: (2024)
by: Xiao, Rui, et al.
Published: (2024)
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
by: Cheng, Dongjie, et al.
Published: (2026)
by: Cheng, Dongjie, et al.
Published: (2026)
SaRO: Enhancing LLM Safety through Reasoning-based Alignment
by: Mou, Yutao, et al.
Published: (2025)
by: Mou, Yutao, et al.
Published: (2025)
GeoVLM-R1: Reinforcement Fine-Tuning for Improved Remote Sensing Reasoning
by: Fiaz, Mustansar, et al.
Published: (2025)
by: Fiaz, Mustansar, et al.
Published: (2025)
iDPA: Instance Decoupled Prompt Attention for Incremental Medical Object Detection
by: Yi, Huahui, et al.
Published: (2025)
by: Yi, Huahui, et al.
Published: (2025)
Towards Context-aware Reasoning-enhanced Generative Searching in E-commerce
by: Liu, Zhiding, et al.
Published: (2025)
by: Liu, Zhiding, et al.
Published: (2025)
Bridging VLM and KMP: Enabling Fine-grained robotic manipulation via Semantic Keypoints Representation
by: Zhu, Junjie, et al.
Published: (2025)
by: Zhu, Junjie, et al.
Published: (2025)
SafeCoT: Improving VLM Safety with Minimal Reasoning
by: Ma, Jiachen, et al.
Published: (2025)
by: Ma, Jiachen, et al.
Published: (2025)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
by: Jiang, Chaoya, et al.
Published: (2025)
by: Jiang, Chaoya, et al.
Published: (2025)
Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning
by: Tang, Jing, et al.
Published: (2026)
by: Tang, Jing, et al.
Published: (2026)
VisuRiddles: Fine-grained Perception is a Primary Bottleneck for Multimodal Large Language Models in Abstract Visual Reasoning
by: Yan, Hao, et al.
Published: (2025)
by: Yan, Hao, et al.
Published: (2025)
Bridging Speech, Emotion, and Motion: a VLM-based Multimodal Edge-deployable Framework for Humanoid Robots
by: Yang, Songhua, et al.
Published: (2026)
by: Yang, Songhua, et al.
Published: (2026)
CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns
by: Zhou, Zhenhong, et al.
Published: (2026)
by: Zhou, Zhenhong, et al.
Published: (2026)
MAFE R-CNN: Selecting More Samples to Learn Category-aware Features for Small Object Detection
by: Li, Yichen, et al.
Published: (2025)
by: Li, Yichen, et al.
Published: (2025)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
by: Gu, Difei, et al.
Published: (2025)
by: Gu, Difei, et al.
Published: (2025)
AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models
by: Wang, Xinyi, et al.
Published: (2025)
by: Wang, Xinyi, et al.
Published: (2025)
Packet-Level DDoS Data Augmentation Using Dual-Stream Temporal-Field Diffusion
by: Xi, Gongli, et al.
Published: (2025)
by: Xi, Gongli, et al.
Published: (2025)
Similar Items
-
SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety
by: Xu, Zixuan, et al.
Published: (2026) -
SaFeR: Safety-Critical Scenario Generation for Autonomous Driving Test via Feasibility-Constrained Token Resampling
by: Cui, Jinlong, et al.
Published: (2026) -
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
by: Xi, Gongli, et al.
Published: (2026) -
Large Vision-Language Models Get Lost in Attention
by: Xi, Gongli, et al.
Published: (2026) -
Unified Modeling Enhanced Multimodal Learning for Precision Neuro-Oncology
by: Yi, Huahui, et al.
Published: (2024)