Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Kejian, Tu, Shangqing, Jin, Zhuoran, Hou, Lei, Li, Juanzi, Zhao, Jun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
von: Tu, Shangqing, et al.
Veröffentlicht: (2025)
von: Tu, Shangqing, et al.
Veröffentlicht: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
von: Zhu, Kejian, et al.
Veröffentlicht: (2025)
von: Zhu, Kejian, et al.
Veröffentlicht: (2025)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
von: Zhao, Yixiu, et al.
Veröffentlicht: (2025)
von: Zhao, Yixiu, et al.
Veröffentlicht: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
von: Tu, Shangqing, et al.
Veröffentlicht: (2024)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
von: Huang, Zhidian, et al.
Veröffentlicht: (2026)
von: Huang, Zhidian, et al.
Veröffentlicht: (2026)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
von: Sun, Kai, et al.
Veröffentlicht: (2024)
von: Sun, Kai, et al.
Veröffentlicht: (2024)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
von: Chen, Jianhui, et al.
Veröffentlicht: (2024)
von: Chen, Jianhui, et al.
Veröffentlicht: (2024)
MAIC-UI: Making Interactive Courseware with Generative UI
von: Tu, Shangqing, et al.
Veröffentlicht: (2026)
von: Tu, Shangqing, et al.
Veröffentlicht: (2026)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
von: Jin, Zhuoran, et al.
Veröffentlicht: (2025)
von: Jin, Zhuoran, et al.
Veröffentlicht: (2025)
Awaking the Slides: A Tuning-free and Knowledge-regulated AI Tutoring System via Language Model Coordination
von: Zhang-Li, Daniel, et al.
Veröffentlicht: (2024)
von: Zhang-Li, Daniel, et al.
Veröffentlicht: (2024)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
von: Cao, Pengfei, et al.
Veröffentlicht: (2024)
von: Cao, Pengfei, et al.
Veröffentlicht: (2024)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
von: Fan, Yuchen, et al.
Veröffentlicht: (2024)
Misconfidence-based Demonstration Selection for LLM In-Context Learning
von: Xu, Shangqing, et al.
Veröffentlicht: (2024)
von: Xu, Shangqing, et al.
Veröffentlicht: (2024)
LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2025)
von: Tu, Shangqing, et al.
Veröffentlicht: (2025)
LecEval: An Automated Metric for Multimodal Knowledge Acquisition in Multimedia Learning
von: Yin, Joy Lim Jia, et al.
Veröffentlicht: (2025)
von: Yin, Joy Lim Jia, et al.
Veröffentlicht: (2025)
Shifting Long-Context LLMs Research from Input to Output
von: Wu, Yuhao, et al.
Veröffentlicht: (2025)
von: Wu, Yuhao, et al.
Veröffentlicht: (2025)
MRCEval: A Comprehensive, Challenging and Accessible Machine Reading Comprehension Benchmark
von: Ma, Shengkun, et al.
Veröffentlicht: (2025)
von: Ma, Shengkun, et al.
Veröffentlicht: (2025)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
von: Bai, Yushi, et al.
Veröffentlicht: (2024)
von: Bai, Yushi, et al.
Veröffentlicht: (2024)
Pre-training Language Model Incorporating Domain-specific Heterogeneous Knowledge into A Unified Representation
von: Zhu, Hongyin, et al.
Veröffentlicht: (2021)
von: Zhu, Hongyin, et al.
Veröffentlicht: (2021)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
von: Chen, Yanxu, et al.
Veröffentlicht: (2025)
von: Chen, Yanxu, et al.
Veröffentlicht: (2025)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
von: Liu, Yantao, et al.
Veröffentlicht: (2024)
von: Liu, Yantao, et al.
Veröffentlicht: (2024)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
von: Zhang, Jiajie, et al.
Veröffentlicht: (2026)
von: Zhang, Jiajie, et al.
Veröffentlicht: (2026)
OpenEP: Open-Ended Future Event Prediction
von: Guan, Yong, et al.
Veröffentlicht: (2024)
von: Guan, Yong, et al.
Veröffentlicht: (2024)
The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation
von: Marioriyad, Arash, et al.
Veröffentlicht: (2026)
von: Marioriyad, Arash, et al.
Veröffentlicht: (2026)
FinRAGBench-V: A Benchmark for Multimodal RAG with Visual Citation in the Financial Domain
von: Zhao, Suifeng, et al.
Veröffentlicht: (2025)
von: Zhao, Suifeng, et al.
Veröffentlicht: (2025)
SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking
von: Wang, Yuanchun, et al.
Veröffentlicht: (2024)
von: Wang, Yuanchun, et al.
Veröffentlicht: (2024)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
von: Lin, Nianyi, et al.
Veröffentlicht: (2025)
von: Lin, Nianyi, et al.
Veröffentlicht: (2025)
LLM Hallucination Detection: HSAD
von: Li, JinXin, et al.
Veröffentlicht: (2025)
von: Li, JinXin, et al.
Veröffentlicht: (2025)
Do LLMs Overcome Shortcut Learning? An Evaluation of Shortcut Challenges in Large Language Models
von: Yuan, Yu, et al.
Veröffentlicht: (2024)
von: Yuan, Yu, et al.
Veröffentlicht: (2024)
LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder
von: Jing, Yi, et al.
Veröffentlicht: (2025)
von: Jing, Yi, et al.
Veröffentlicht: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
von: Xia, Haotian, et al.
Veröffentlicht: (2026)
von: Xia, Haotian, et al.
Veröffentlicht: (2026)
Navigating the Shortcut Maze: A Comprehensive Analysis of Shortcut Learning in Text Classification by Language Models
von: Zhou, Yuqing, et al.
Veröffentlicht: (2024)
von: Zhou, Yuqing, et al.
Veröffentlicht: (2024)
EventSum: A Large-Scale Event-Centric Summarization Dataset for Chinese Multi-News Documents
von: Zhu, Mengna, et al.
Veröffentlicht: (2024)
von: Zhu, Mengna, et al.
Veröffentlicht: (2024)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
von: Li, Jiachun, et al.
Veröffentlicht: (2024)
von: Li, Jiachun, et al.
Veröffentlicht: (2024)
Improving Generalization in LLM Structured Pruning via Function-Aware Neuron Grouping
von: Yu, Tao, et al.
Veröffentlicht: (2025)
von: Yu, Tao, et al.
Veröffentlicht: (2025)
TrustScore: Reference-Free Evaluation of LLM Response Trustworthiness
von: Zheng, Danna, et al.
Veröffentlicht: (2024)
von: Zheng, Danna, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
von: Tu, Shangqing, et al.
Veröffentlicht: (2024) -
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
von: Tu, Shangqing, et al.
Veröffentlicht: (2023) -
DeepPrune: Parallel Scaling without Inter-trace Redundancy
von: Tu, Shangqing, et al.
Veröffentlicht: (2025) -
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2023) -
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
von: Zhu, Kejian, et al.
Veröffentlicht: (2025)