DeepSight: An All-in-One LM Safety Toolkit
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Bo, Guo, Jiaxuan, Li, Lijun, Liu, Dongrui, Chen, Sujin, Chen, Guanxu, Zheng, Zhijie, Lin, Qihao, Yan, Lewen, Qian, Chen, Zhou, Yijin, Wu, Yuyao, Guo, Shaoxiong, Du, Tianyi, Yang, Jingyi, Hu, Xuhao, Miao, Ziqi, Lu, Xiaoya, Shao, Jing, Hu, Xia |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
by: Yang, Jingyi, et al.
Published: (2025)
by: Yang, Jingyi, et al.
Published: (2025)
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
by: Chen, Guanxu, et al.
Published: (2025)
by: Chen, Guanxu, et al.
Published: (2025)
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
by: Lu, Xiaoya, et al.
Published: (2025)
by: Lu, Xiaoya, et al.
Published: (2025)
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
by: Chen, Guanxu, et al.
Published: (2026)
by: Chen, Guanxu, et al.
Published: (2026)
DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model
by: Yang, Hao, et al.
Published: (2026)
by: Yang, Hao, et al.
Published: (2026)
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
by: Li, Xudong, et al.
Published: (2026)
by: Li, Xudong, et al.
Published: (2026)
LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions
by: Hu, Xuhao, et al.
Published: (2025)
by: Hu, Xuhao, et al.
Published: (2025)
CHEMSMART: Chemistry Simulation and Modeling Automation Toolkit for High-Efficiency Computational Chemistry Workflows
by: Zhang, Xinglong, et al.
Published: (2025)
by: Zhang, Xinglong, et al.
Published: (2025)
PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning
by: Lin, Qihao, et al.
Published: (2026)
by: Lin, Qihao, et al.
Published: (2026)
DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving
by: Zhang, Lingjun, et al.
Published: (2026)
by: Zhang, Lingjun, et al.
Published: (2026)
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report v1.5
by: Liu, Dongrui, et al.
Published: (2026)
by: Liu, Dongrui, et al.
Published: (2026)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
by: Chen, Guanxu, et al.
Published: (2025)
by: Chen, Guanxu, et al.
Published: (2025)
VLSBench: Unveiling Visual Leakage in Multimodal Safety
by: Hu, Xuhao, et al.
Published: (2024)
by: Hu, Xuhao, et al.
Published: (2024)
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report
by: Lab, Shanghai AI, et al.
Published: (2025)
by: Lab, Shanghai AI, et al.
Published: (2025)
Rethinking Entropy Regularization in Large Reasoning Models
by: Jiang, Yuxian, et al.
Published: (2025)
by: Jiang, Yuxian, et al.
Published: (2025)
Wasserstein Distributionally Robust Rare-Event Simulation
by: Ahn, Dohyun, et al.
Published: (2026)
by: Ahn, Dohyun, et al.
Published: (2026)
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task
by: Lu, Xiaoya, et al.
Published: (2026)
by: Lu, Xiaoya, et al.
Published: (2026)
Valence-Arousal Subspace in LLMs: Circular Emotion Geometry and Multi-Behavioral Control
by: Sun, Lihao, et al.
Published: (2026)
by: Sun, Lihao, et al.
Published: (2026)
CogLM: Tracking Cognitive Development of Large Language Models
by: Wang, Xinglin, et al.
Published: (2024)
by: Wang, Xinglin, et al.
Published: (2024)
ESPnet-SpeechLM: An Open Speech Language Model Toolkit
by: Tian, Jinchuan, et al.
Published: (2025)
by: Tian, Jinchuan, et al.
Published: (2025)
ReaLM: Residual Quantization Bridging Knowledge Graph Embeddings and Large Language Models
by: Guo, Wenbin, et al.
Published: (2025)
by: Guo, Wenbin, et al.
Published: (2025)
How Many Languages Make Good Multilingual Instruction Tuning? A Case Study on BLOOM
by: Ji, Shaoxiong, et al.
Published: (2024)
by: Ji, Shaoxiong, et al.
Published: (2024)
Geometrically-Constrained Agent for Spatial Reasoning
by: Chen, Zeren, et al.
Published: (2025)
by: Chen, Zeren, et al.
Published: (2025)
FinSight: Towards Real-World Financial Deep Research
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
by: Guo, Shaoxiong, et al.
Published: (2025)
by: Guo, Shaoxiong, et al.
Published: (2025)
DARE: Diffusion Large Language Models Alignment and Reinforcement Executor
by: Yang, Jingyi, et al.
Published: (2026)
by: Yang, Jingyi, et al.
Published: (2026)
DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models
by: Hong, Zhaochen, et al.
Published: (2026)
by: Hong, Zhaochen, et al.
Published: (2026)
A Single Simple Patch is All You Need for AI-generated Image Detection
by: Chen, Jiaxuan, et al.
Published: (2024)
by: Chen, Jiaxuan, et al.
Published: (2024)
RvB: Automating AI System Hardening via Iterative Red-Blue Games
by: Huang, Lige, et al.
Published: (2026)
by: Huang, Lige, et al.
Published: (2026)
COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation
by: Zhou, Tianyi, et al.
Published: (2026)
by: Zhou, Tianyi, et al.
Published: (2026)
X-Boundary: Establishing Exact Safety Boundary to Shield LLMs from Multi-Turn Jailbreaks without Compromising Usability
by: Lu, Xiaoya, et al.
Published: (2025)
by: Lu, Xiaoya, et al.
Published: (2025)
SEVADE: Self-Evolving Multi-Agent Analysis with Decoupled Evaluation for Hallucination-Resistant Irony Detection
by: Liu, Ziqi, et al.
Published: (2025)
by: Liu, Ziqi, et al.
Published: (2025)
BAMBINO-LM: (Bilingual-)Human-Inspired Continual Pretraining of BabyLM
by: Shen, Zhewen, et al.
Published: (2024)
by: Shen, Zhewen, et al.
Published: (2024)
Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image
by: Zhang, Kaidi, et al.
Published: (2026)
by: Zhang, Kaidi, et al.
Published: (2026)
NeuV-SLAM: Fast Neural Multiresolution Voxel Optimization for RGBD Dense SLAM
by: Guo, Wenzhi, et al.
Published: (2024)
by: Guo, Wenzhi, et al.
Published: (2024)
SpikeZIP-TF: Conversion is All You Need for Transformer-based SNN
by: You, Kang, et al.
Published: (2024)
by: You, Kang, et al.
Published: (2024)
KG-BiLM: Knowledge Graph Embedding via Bidirectional Language Models
by: Chen, Zirui, et al.
Published: (2025)
by: Chen, Zirui, et al.
Published: (2025)
Causally Aware Generative Adversarial Networks for Light Pollution Control
by: Zhang, Yuyao, et al.
Published: (2024)
by: Zhang, Yuyao, et al.
Published: (2024)
Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?
by: Sun, Zetian, et al.
Published: (2025)
by: Sun, Zetian, et al.
Published: (2025)
NativE: Multi-modal Knowledge Graph Completion in the Wild
by: Zhang, Yichi, et al.
Published: (2024)
by: Zhang, Yichi, et al.
Published: (2024)
Similar Items
-
Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step
by: Yang, Jingyi, et al.
Published: (2025) -
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
by: Chen, Guanxu, et al.
Published: (2025) -
IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents in Daily Household Tasks
by: Lu, Xiaoya, et al.
Published: (2025) -
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
by: Chen, Guanxu, et al.
Published: (2026) -
DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model
by: Yang, Hao, et al.
Published: (2026)