ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Xinyan, Liu, Xiaogeng, Xiao, Chaowei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
por: Huang, Yao, et al.
Publicado: (2025)
por: Huang, Yao, et al.
Publicado: (2025)
Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
por: Bin, Yi, et al.
Publicado: (2025)
por: Bin, Yi, et al.
Publicado: (2025)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
por: Liu, Xiaogeng, et al.
Publicado: (2026)
por: Liu, Xiaogeng, et al.
Publicado: (2026)
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
por: Liu, Xiaogeng, et al.
Publicado: (2023)
por: Liu, Xiaogeng, et al.
Publicado: (2023)
Overthinking the Truth: Understanding how Language Models Process False Demonstrations
por: Halawi, Danny, et al.
Publicado: (2023)
por: Halawi, Danny, et al.
Publicado: (2023)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
por: Fan, Chenrui, et al.
Publicado: (2025)
por: Fan, Chenrui, et al.
Publicado: (2025)
Mitigating Overthinking through Reasoning Shaping
por: Song, Feifan, et al.
Publicado: (2025)
por: Song, Feifan, et al.
Publicado: (2025)
Don't "Overthink" Passage Reranking: Is Reasoning Truly Necessary?
por: Jedidi, Nour, et al.
Publicado: (2025)
por: Jedidi, Nour, et al.
Publicado: (2025)
From Shortcuts to Triggers: Backdoor Defense with Denoised PoE
por: Liu, Qin, et al.
Publicado: (2023)
por: Liu, Qin, et al.
Publicado: (2023)
Preference Poisoning Attacks on Reward Model Learning
por: Wu, Junlin, et al.
Publicado: (2024)
por: Wu, Junlin, et al.
Publicado: (2024)
Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
InjecGuard: Benchmarking and Mitigating Over-defense in Prompt Injection Guardrail Models
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Stream Aligner: Efficient Sentence-Level Alignment via Distribution Induction
por: Lou, Hantao, et al.
Publicado: (2025)
por: Lou, Hantao, et al.
Publicado: (2025)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
Mitigating Overthinking in Large Reasoning Language Models via Reasoning Path Deviation Monitoring
por: Guan, Weixin, et al.
Publicado: (2026)
por: Guan, Weixin, et al.
Publicado: (2026)
Understanding In-context Learning of Addition via Activation Subspaces
por: Hu, Xinyan, et al.
Publicado: (2025)
por: Hu, Xinyan, et al.
Publicado: (2025)
Reward Shaping to Mitigate Reward Hacking in RLHF
por: Fu, Jiayi, et al.
Publicado: (2025)
por: Fu, Jiayi, et al.
Publicado: (2025)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
por: Gao, Cheng, et al.
Publicado: (2026)
por: Gao, Cheng, et al.
Publicado: (2026)
Mitigating Hallucinations in Large Language Models via Causal Reasoning
por: Li, Yuangang, et al.
Publicado: (2025)
por: Li, Yuangang, et al.
Publicado: (2025)
Real Time Detection and Quantitative Analysis of Spurious Forgetting in Continual Learning
por: Wang, Weiwei
Publicado: (2025)
por: Wang, Weiwei
Publicado: (2025)
Ever: Mitigating Hallucination in Large Language Models through Real-Time Verification and Rectification
por: Kang, Haoqiang, et al.
Publicado: (2023)
por: Kang, Haoqiang, et al.
Publicado: (2023)
In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination Mitigation
por: Chen, Shiqi, et al.
Publicado: (2024)
por: Chen, Shiqi, et al.
Publicado: (2024)
Mitigating LLM Hallucinations via Conformal Abstention
por: Yadkori, Yasin Abbasi, et al.
Publicado: (2024)
por: Yadkori, Yasin Abbasi, et al.
Publicado: (2024)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
por: Xu, Jiashu, et al.
Publicado: (2023)
por: Xu, Jiashu, et al.
Publicado: (2023)
TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization
por: Fu, Lucheng, et al.
Publicado: (2026)
por: Fu, Lucheng, et al.
Publicado: (2026)
Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation
por: Mündler, Niels, et al.
Publicado: (2023)
por: Mündler, Niels, et al.
Publicado: (2023)
Data Cartography for Detecting Memorization Hotspots and Guiding Data Interventions in Generative Models
por: Patel, Laksh, et al.
Publicado: (2025)
por: Patel, Laksh, et al.
Publicado: (2025)
Multi-Attribute Steering of Language Models via Targeted Intervention
por: Nguyen, Duy, et al.
Publicado: (2025)
por: Nguyen, Duy, et al.
Publicado: (2025)
Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture
por: Pugh, Samuel L, et al.
Publicado: (2026)
por: Pugh, Samuel L, et al.
Publicado: (2026)
Deception Detection from Linguistic and Physiological Data Streams Using Bimodal Convolutional Neural Networks
por: Li, Panfeng, et al.
Publicado: (2023)
por: Li, Panfeng, et al.
Publicado: (2023)
TingIS: Real-time Risk Event Discovery from Noisy Customer Incidents at Enterprise Scale
por: Wang, Jun, et al.
Publicado: (2026)
por: Wang, Jun, et al.
Publicado: (2026)
DRAGON: Guard LLM Unlearning in Context via Negative Detection and Reasoning
por: Wang, Yaxuan, et al.
Publicado: (2025)
por: Wang, Yaxuan, et al.
Publicado: (2025)
Mitigating Reversal Curse in Large Language Models via Semantic-aware Permutation Training
por: Guo, Qingyan, et al.
Publicado: (2024)
por: Guo, Qingyan, et al.
Publicado: (2024)
Synthetic Prefixes to Mitigate Bias in Real-Time Neural Query Autocomplete
por: Rajan, Adithya, et al.
Publicado: (2025)
por: Rajan, Adithya, et al.
Publicado: (2025)
Mitigating Overthinking in Large Reasoning Models via Difficulty-aware Reinforcement Learning
por: Wan, Qian, et al.
Publicado: (2026)
por: Wan, Qian, et al.
Publicado: (2026)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
por: Wang, Ye, et al.
Publicado: (2026)
por: Wang, Ye, et al.
Publicado: (2026)
Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
por: Ono, Shinnosuke, et al.
Publicado: (2026)
por: Ono, Shinnosuke, et al.
Publicado: (2026)
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
por: Hu, Xiaomeng, et al.
Publicado: (2025)
por: Hu, Xiaomeng, et al.
Publicado: (2025)
Stream of Search (SoS): Learning to Search in Language
por: Gandhi, Kanishk, et al.
Publicado: (2024)
por: Gandhi, Kanishk, et al.
Publicado: (2024)
Ejemplares similares
-
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
por: Huang, Yao, et al.
Publicado: (2025) -
Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation
por: Bin, Yi, et al.
Publicado: (2025) -
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
por: Liu, Xiaogeng, et al.
Publicado: (2026) -
AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models
por: Liu, Xiaogeng, et al.
Publicado: (2023) -
Overthinking the Truth: Understanding how Language Models Process False Demonstrations
por: Halawi, Danny, et al.
Publicado: (2023)