Guardado en:
| Autores principales: | Jing, Yi, Yao, Zijun, Guo, Hongzhu, Ran, Lingxu, Wang, Xiaozhi, Hou, Lei, Li, Juanzi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2502.20344 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
por: Jing, Yi, et al.
Publicado: (2026)
por: Jing, Yi, et al.
Publicado: (2026)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025)
por: Zhao, Yixiu, et al.
Publicado: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
Exploring Task Performance with Interpretable Models via Sparse Auto-Encoders
por: Wang, Shun, et al.
Publicado: (2025)
por: Wang, Shun, et al.
Publicado: (2025)
ADELIE: Aligning Large Language Models on Information Extraction
por: Qi, Yunjia, et al.
Publicado: (2024)
por: Qi, Yunjia, et al.
Publicado: (2024)
Constraint Back-translation Improves Complex Instruction Following of Large Language Models
por: Qi, Yunjia, et al.
Publicado: (2024)
por: Qi, Yunjia, et al.
Publicado: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
AtomR: Atomic Operator-Empowered Large Language Models for Heterogeneous Knowledge Reasoning
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
por: Fan, Yuchen, et al.
Publicado: (2024)
por: Fan, Yuchen, et al.
Publicado: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking
por: Xin, Amy, et al.
Publicado: (2024)
por: Xin, Amy, et al.
Publicado: (2024)
Understanding the Mechanism of Altruism in Large Language Models
por: Zhang, Shuhuai, et al.
Publicado: (2026)
por: Zhang, Shuhuai, et al.
Publicado: (2026)
OpenEP: Open-Ended Future Event Prediction
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
AGENTIF: Benchmarking Instruction Following of Large Language Models in Agentic Scenarios
por: Qi, Yunjia, et al.
Publicado: (2025)
por: Qi, Yunjia, et al.
Publicado: (2025)
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
Sparse Auto-Encoders and Holism about Large Language Models
por: Grindrod, Jumbly
Publicado: (2026)
por: Grindrod, Jumbly
Publicado: (2026)
MAVEN-Fact: A Large-scale Event Factuality Detection Dataset
por: Li, Chunyang, et al.
Publicado: (2024)
por: Li, Chunyang, et al.
Publicado: (2024)
HalluSAE: Detecting Hallucinations in Large Language Models via Sparse Auto-Encoders
por: Chen, Boshui, et al.
Publicado: (2026)
por: Chen, Boshui, et al.
Publicado: (2026)
PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
por: Liu, Yantao, et al.
Publicado: (2025)
por: Liu, Yantao, et al.
Publicado: (2025)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation
por: Yu, Jifan, et al.
Publicado: (2024)
por: Yu, Jifan, et al.
Publicado: (2024)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
VerIF: Verification Engineering for Reinforcement Learning in Instruction Following
por: Peng, Hao, et al.
Publicado: (2025)
por: Peng, Hao, et al.
Publicado: (2025)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
por: Lin, Nianyi, et al.
Publicado: (2025)
por: Lin, Nianyi, et al.
Publicado: (2025)
StoryWriter: A Multi-Agent Framework for Long Story Generation
por: Xia, Haotian, et al.
Publicado: (2025)
por: Xia, Haotian, et al.
Publicado: (2025)
StoryAlign: Evaluating and Training Reward Models for Story Generation
por: Xia, Haotian, et al.
Publicado: (2026)
por: Xia, Haotian, et al.
Publicado: (2026)
TacoERE: Cluster-aware Compression for Event Relation Extraction
por: Guan, Yong, et al.
Publicado: (2024)
por: Guan, Yong, et al.
Publicado: (2024)
SOSAE: Self-Organizing Sparse AutoEncoder
por: Modi, Sarthak Ketanbhai, et al.
Publicado: (2025)
por: Modi, Sarthak Ketanbhai, et al.
Publicado: (2025)
AudioSAE: Towards Understanding of Audio-Processing Models with Sparse AutoEncoders
por: Aparin, Georgii, et al.
Publicado: (2026)
por: Aparin, Georgii, et al.
Publicado: (2026)
Transferable and Efficient Non-Factual Content Detection via Probe Training with Offline Consistency Checking
por: Zhang, Xiaokang, et al.
Publicado: (2024)
por: Zhang, Xiaokang, et al.
Publicado: (2024)
DecoderLens: Layerwise Interpretation of Encoder-Decoder Transformers
por: Langedijk, Anna, et al.
Publicado: (2023)
por: Langedijk, Anna, et al.
Publicado: (2023)
Reverse That Number! Decoding Order Matters in Arithmetic Learning
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
por: Chen, Yanxu, et al.
Publicado: (2025)
por: Chen, Yanxu, et al.
Publicado: (2025)
SeaKR: Self-aware Knowledge Retrieval for Adaptive Retrieval Augmented Generation
por: Yao, Zijun, et al.
Publicado: (2024)
por: Yao, Zijun, et al.
Publicado: (2024)
A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models
por: Shu, Dong, et al.
Publicado: (2025)
por: Shu, Dong, et al.
Publicado: (2025)
Ejemplares similares
-
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
por: Jing, Yi, et al.
Publicado: (2026) -
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024) -
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025) -
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026) -
Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
por: Peng, Hao, et al.
Publicado: (2025)