TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
Fuente:
arXiv
Salvato in:
| Autori principali: | Shi, Chuancheng, Li, Shangze, Lu, Wenjun, Wu, Wenhua, Wang, Cong, Cheng, Zifeng, Shen, Fei, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
di: Liu, Zhiyuan, et al.
Pubblicazione: (2023)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2023)
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
di: Shi, Chuancheng, et al.
Pubblicazione: (2025)
di: Shi, Chuancheng, et al.
Pubblicazione: (2025)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
di: Li, Shaotian, et al.
Pubblicazione: (2026)
di: Li, Shaotian, et al.
Pubblicazione: (2026)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
di: Luo, Run, et al.
Pubblicazione: (2025)
di: Luo, Run, et al.
Pubblicazione: (2025)
ReactXT: Understanding Molecular "Reaction-ship" via Reaction-Contextualized Molecule-Text Pretraining
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024)
Principled Multimodal Representation Learning
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
di: Lan, Xing, et al.
Pubblicazione: (2024)
di: Lan, Xing, et al.
Pubblicazione: (2024)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
Simple but Effective Raw-Data Level Multimodal Fusion for Composed Image Retrieval
di: Wen, Haokun, et al.
Pubblicazione: (2024)
di: Wen, Haokun, et al.
Pubblicazione: (2024)
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
di: Liu, Han, et al.
Pubblicazione: (2025)
di: Liu, Han, et al.
Pubblicazione: (2025)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
Towards Temporal-Aware Multi-Modal Retrieval Augmented Generation in Finance
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
di: Zhu, Fengbin, et al.
Pubblicazione: (2025)
A Picture Is Worth a Graph: A Blueprint Debate Paradigm for Multimodal Reasoning
di: Zheng, Changmeng, et al.
Pubblicazione: (2024)
di: Zheng, Changmeng, et al.
Pubblicazione: (2024)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
Logic Unseen: Revealing the Logical Blindspots of Vision-Language Models
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
di: Zhou, Yuchen, et al.
Pubblicazione: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
TTOM: Test-Time Optimization and Memorization for Compositional Video Generation
di: Qu, Leigang, et al.
Pubblicazione: (2025)
di: Qu, Leigang, et al.
Pubblicazione: (2025)
Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
Multi-Modal Image Fusion via Intervention-Stable Feature Learning
di: Wang, Xue, et al.
Pubblicazione: (2026)
di: Wang, Xue, et al.
Pubblicazione: (2026)
Calibrated Multimodal Representation Learning with Missing Modalities
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
VINCIE: Unlocking In-context Image Editing from Video
di: Qu, Leigang, et al.
Pubblicazione: (2025)
di: Qu, Leigang, et al.
Pubblicazione: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
di: Li, Yongqi, et al.
Pubblicazione: (2024)
di: Li, Yongqi, et al.
Pubblicazione: (2024)
EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
di: Fang, Jianwu, et al.
Pubblicazione: (2025)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
di: Liu, Dancheng, et al.
Pubblicazione: (2025)
di: Liu, Dancheng, et al.
Pubblicazione: (2025)
Smart Fitting Room: A One-stop Framework for Matching-aware Virtual Try-on
di: Yu, Mingzhe, et al.
Pubblicazione: (2024)
di: Yu, Mingzhe, et al.
Pubblicazione: (2024)
ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes
di: Cheng, Zihang, et al.
Pubblicazione: (2026)
di: Cheng, Zihang, et al.
Pubblicazione: (2026)
CIRP: Cross-Item Relational Pre-training for Multimodal Product Bundling
di: Ma, Yunshan, et al.
Pubblicazione: (2024)
di: Ma, Yunshan, et al.
Pubblicazione: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
di: Hu, Anwen, et al.
Pubblicazione: (2023)
di: Hu, Anwen, et al.
Pubblicazione: (2023)
PathAsst: A Generative Foundation AI Assistant Towards Artificial General Intelligence of Pathology
di: Sun, Yuxuan, et al.
Pubblicazione: (2023)
di: Sun, Yuxuan, et al.
Pubblicazione: (2023)
A Benchmark and Robustness Study of In-Context-Learning with Large Language Models in Music Entity Detection
di: Hachmeier, Simon, et al.
Pubblicazione: (2024)
di: Hachmeier, Simon, et al.
Pubblicazione: (2024)
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
di: Wang, Xinyu, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026) -
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025) -
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
di: Liu, Zhiyuan, et al.
Pubblicazione: (2023) -
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
di: Liu, Zhiyuan, et al.
Pubblicazione: (2024) -
Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation
di: Shi, Chuancheng, et al.
Pubblicazione: (2025)