Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jiachun, Cao, Pengfei, Wang, Chenhao, Jin, Zhuoran, Chen, Yubo, Zeng, Daojian, Liu, Kang, Zhao, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2026)
di: Li, Jiachun, et al.
Pubblicazione: (2026)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
di: Men, Tianyi, et al.
Pubblicazione: (2024)
di: Men, Tianyi, et al.
Pubblicazione: (2024)
RWKU: Benchmarking Real-World Knowledge Unlearning for Large Language Models
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
di: Jin, Zhuoran, et al.
Pubblicazione: (2025)
Cutting Off the Head Ends the Conflict: A Mechanism for Interpreting and Mitigating Knowledge Conflicts in Language Models
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
EvoEdit: Lifelong Free-Text Knowledge Editing through Latent Perturbation Augmentation and Knowledge-driven Parameter Fusion
di: Cao, Pengfei, et al.
Pubblicazione: (2025)
di: Cao, Pengfei, et al.
Pubblicazione: (2025)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
di: Cao, Pengfei, et al.
Pubblicazione: (2024)
di: Cao, Pengfei, et al.
Pubblicazione: (2024)
Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling
di: Li, Jiachun, et al.
Pubblicazione: (2025)
di: Li, Jiachun, et al.
Pubblicazione: (2025)
A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
di: Men, Tianyi, et al.
Pubblicazione: (2024)
di: Men, Tianyi, et al.
Pubblicazione: (2024)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
di: Men, Tianyi, et al.
Pubblicazione: (2025)
di: Men, Tianyi, et al.
Pubblicazione: (2025)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Generating Effective CoT Traces for Mitigating Causal Hallucination
di: Zhao, Yiheng, et al.
Pubblicazione: (2026)
di: Zhao, Yiheng, et al.
Pubblicazione: (2026)
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
di: Hao, Yupu, et al.
Pubblicazione: (2024)
di: Hao, Yupu, et al.
Pubblicazione: (2024)
DTELS: Towards Dynamic Granularity of Timeline Summarization
di: Zhang, Chenlong, et al.
Pubblicazione: (2024)
di: Zhang, Chenlong, et al.
Pubblicazione: (2024)
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
di: Hao, Yupu, et al.
Pubblicazione: (2025)
di: Hao, Yupu, et al.
Pubblicazione: (2025)
RAG-RewardBench: Benchmarking Reward Models in Retrieval Augmented Generation for Preference Alignment
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
AgentsCourt: Building Judicial Decision-Making Agents with Court Debate Simulation and Legal Knowledge Augmentation
di: He, Zhitao, et al.
Pubblicazione: (2024)
di: He, Zhitao, et al.
Pubblicazione: (2024)
Towards Better Chain-of-Thought: A Reflection on Effectiveness and Faithfulness
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
Zero-Shot Cross-Lingual Document-Level Event Causality Identification with Heterogeneous Graph Contrastive Transfer Learning
di: He, Zhitao, et al.
Pubblicazione: (2024)
di: He, Zhitao, et al.
Pubblicazione: (2024)
Tug-of-War Between Knowledge: Exploring and Resolving Knowledge Conflicts in Retrieval-Augmented Language Models
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
di: Jin, Zhuoran, et al.
Pubblicazione: (2024)
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
di: Jin, Senjie, et al.
Pubblicazione: (2025)
di: Jin, Senjie, et al.
Pubblicazione: (2025)
Revealing the Deceptiveness of Knowledge Editing: A Mechanistic Analysis of Superficial Editing
di: Xie, Jiakuan, et al.
Pubblicazione: (2025)
di: Xie, Jiakuan, et al.
Pubblicazione: (2025)
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
Knowledge Localization: Mission Not Accomplished? Enter Query Localization!
di: Chen, Yuheng, et al.
Pubblicazione: (2024)
di: Chen, Yuheng, et al.
Pubblicazione: (2024)
WilKE: Wise-Layer Knowledge Editor for Lifelong Knowledge Editing
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
di: Hu, Chenhui, et al.
Pubblicazione: (2024)
Towards Atoms of Large Language Models
di: Hu, Chenhui, et al.
Pubblicazione: (2025)
di: Hu, Chenhui, et al.
Pubblicazione: (2025)
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
di: Wang, Lu, et al.
Pubblicazione: (2026)
di: Wang, Lu, et al.
Pubblicazione: (2026)
MEMLA: Enhancing Multilingual Knowledge Editing with Neuron-Masked Low-Rank Adaptation
di: Xie, Jiakuan, et al.
Pubblicazione: (2024)
di: Xie, Jiakuan, et al.
Pubblicazione: (2024)
SemEval-2026 Task 12: Abductive Event Reasoning: Towards Real-World Event Causal Inference for Large Language Models
di: Cao, Pengfei, et al.
Pubblicazione: (2026)
di: Cao, Pengfei, et al.
Pubblicazione: (2026)
Can LLMs Reason Abstractly Over Math Word Problems Without CoT? Disentangling Abstract Formulation From Arithmetic Computation
di: Cheng, Ziling, et al.
Pubblicazione: (2025)
di: Cheng, Ziling, et al.
Pubblicazione: (2025)
Long or short CoT? Investigating Instance-level Switch of Large Reasoning Models
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
di: Zhang, Ruiqi, et al.
Pubblicazione: (2025)
Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning
di: Yan, Shaotian, et al.
Pubblicazione: (2026)
di: Yan, Shaotian, et al.
Pubblicazione: (2026)
Investigating CoT Monitorability in Large Reasoning Models
di: Yang, Shu, et al.
Pubblicazione: (2025)
di: Yang, Shu, et al.
Pubblicazione: (2025)
One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL
di: Chae, Hyungjoo, et al.
Pubblicazione: (2025)
di: Chae, Hyungjoo, et al.
Pubblicazione: (2025)
EFT-CoT: A Multi-Agent Chain-of-Thought Framework for Emotion-Focused Therapy
di: Du, Lanqing, et al.
Pubblicazione: (2026)
di: Du, Lanqing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2024) -
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024) -
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
di: Li, Jiachun, et al.
Pubblicazione: (2024) -
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2026) -
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
di: Men, Tianyi, et al.
Pubblicazione: (2024)