Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
Fuente:
arXiv
Salvato in:
| Autori principali: | Zang, Jianxiang, Ning, Meiling, Wei, Yongda, Dou, Shihan, Zhang, Jiazheng, Mo, Nijia, Li, Binhong, Gui, Tao, Zhang, Qi, Huang, Xuanjing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
S2Sent: Nested Selectivity Aware Sentence Representation Learning
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
di: Zang, Jianxiang, et al.
Pubblicazione: (2025)
Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
di: Zang, Jianxiang
Pubblicazione: (2025)
di: Zang, Jianxiang
Pubblicazione: (2025)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025)
di: Dou, Shihan, et al.
Pubblicazione: (2025)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)
di: Lv, Huijie, et al.
Pubblicazione: (2024)
Unveiling Linguistic Regions in Large Language Models
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
di: Zhang, Zhihao, et al.
Pubblicazione: (2024)
Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges
di: Wang, Xiaohua, et al.
Pubblicazione: (2026)
di: Wang, Xiaohua, et al.
Pubblicazione: (2026)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Multi-Programming Language Sandbox for LLMs
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
Explanation based Bias Decoupling Regularization for Natural Language Inference
di: Zang, Jianxiang, et al.
Pubblicazione: (2024)
di: Zang, Jianxiang, et al.
Pubblicazione: (2024)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
di: Zhao, Jun, et al.
Pubblicazione: (2024)
di: Zhao, Jun, et al.
Pubblicazione: (2024)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
di: Liu, Boyang, et al.
Pubblicazione: (2025)
di: Liu, Boyang, et al.
Pubblicazione: (2025)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective
di: Li, Tianlong, et al.
Pubblicazione: (2024)
di: Li, Tianlong, et al.
Pubblicazione: (2024)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2025)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
di: Wang, Junzhe, et al.
Pubblicazione: (2026)
Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
di: Yang, Yuming, et al.
Pubblicazione: (2025)
di: Yang, Yuming, et al.
Pubblicazione: (2025)
Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models
di: Zhou, Xin, et al.
Pubblicazione: (2025)
di: Zhou, Xin, et al.
Pubblicazione: (2025)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
di: Xu, Nuo, et al.
Pubblicazione: (2024)
di: Xu, Nuo, et al.
Pubblicazione: (2024)
Steering LLMs via Scalable Interactive Oversight
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
di: Zhou, Enyu, et al.
Pubblicazione: (2026)
Chiral Analysis for High‐Throughput Reaction Screening: Recent Advances in Accelerating Asymmetric Catalysis Discovery
di: Nijia Yu, et al.
Pubblicazione: (2026)
di: Nijia Yu, et al.
Pubblicazione: (2026)
DocFusion: A Unified Framework for Document Parsing Tasks
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
di: Chai, Mingxu, et al.
Pubblicazione: (2024)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
di: Zhang, Yuansen, et al.
Pubblicazione: (2024)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
di: Cao, Yifei, et al.
Pubblicazione: (2025)
di: Cao, Yifei, et al.
Pubblicazione: (2025)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
di: Jiang, Changhao, et al.
Pubblicazione: (2025)
MetaRM: Shifted Distributions Alignment via Meta-Learning
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
The Energy Loss Phenomenon in RLHF: A New Perspective on Mitigating Reward Hacking
di: Miao, Yuchun, et al.
Pubblicazione: (2025)
di: Miao, Yuchun, et al.
Pubblicazione: (2025)
Modeling Selective Feature Attention for Representation-based Siamese Text Matching
di: Zang, Jianxiang, et al.
Pubblicazione: (2024)
di: Zang, Jianxiang, et al.
Pubblicazione: (2024)
CCTU: A Benchmark for Tool Use under Complex Constraints
di: Ye, Junjie, et al.
Pubblicazione: (2026)
di: Ye, Junjie, et al.
Pubblicazione: (2026)
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
di: Zhang, Ming, et al.
Pubblicazione: (2024)
di: Zhang, Ming, et al.
Pubblicazione: (2024)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
di: Wang, Yuhui, et al.
Pubblicazione: (2026)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
What's Wrong with Your Code Generated by Large Language Models? An Extensive Study
di: Dou, Shihan, et al.
Pubblicazione: (2024)
di: Dou, Shihan, et al.
Pubblicazione: (2024)
LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition
di: Ye, Junjie, et al.
Pubblicazione: (2024)
di: Ye, Junjie, et al.
Pubblicazione: (2024)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
Are Large Language Models Good Prompt Optimizers?
di: Ma, Ruotian, et al.
Pubblicazione: (2024)
di: Ma, Ruotian, et al.
Pubblicazione: (2024)
Domain Generalization via Causal Adjustment for Cross-Domain Sentiment Analysis
di: Wang, Siyin, et al.
Pubblicazione: (2024)
di: Wang, Siyin, et al.
Pubblicazione: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
di: Zheng, Rui, et al.
Pubblicazione: (2024)
di: Zheng, Rui, et al.
Pubblicazione: (2024)
Forecasts of CMB $E$-mode anomalies for AliCPT-1
di: Dou, Jiazheng, et al.
Pubblicazione: (2026)
di: Dou, Jiazheng, et al.
Pubblicazione: (2026)
Forecasts of constraining isotropic cosmic birefringence on AliCPT-1
di: Dou, Jiazheng, et al.
Pubblicazione: (2025)
di: Dou, Jiazheng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
S2Sent: Nested Selectivity Aware Sentence Representation Learning
di: Zang, Jianxiang, et al.
Pubblicazione: (2025) -
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
di: Zang, Jianxiang, et al.
Pubblicazione: (2025) -
Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation
di: Zang, Jianxiang
Pubblicazione: (2025) -
Improving RL Exploration for LLM Reasoning through Retrospective Replay
di: Dou, Shihan, et al.
Pubblicazione: (2025) -
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
di: Lv, Huijie, et al.
Pubblicazione: (2024)