Towards Tracing Trustworthiness Dynamics: Revisiting Pre-training Period of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Qian, Chen, Zhang, Jie, Yao, Wei, Liu, Dongrui, Yin, Zhenfei, Qiao, Yu, Liu, Yong, Shao, Jing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
The Better Angels of Machine Personality: How Personality Relates to LLM Safety
di: Zhang, Jie, et al.
Pubblicazione: (2024)
di: Zhang, Jie, et al.
Pubblicazione: (2024)
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
di: Qian, Chen, et al.
Pubblicazione: (2025)
di: Qian, Chen, et al.
Pubblicazione: (2025)
Model Merging in Pre-training of Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2025)
di: Li, Yunshui, et al.
Pubblicazione: (2025)
ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
di: Yang, Junyao, et al.
Pubblicazione: (2026)
di: Yang, Junyao, et al.
Pubblicazione: (2026)
Towards Label-Only Membership Inference Attack against Pre-trained Large Language Models
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
The Tug of War Within: Mitigating the Fairness-Privacy Conflicts in Large Language Models
di: Qian, Chen, et al.
Pubblicazione: (2024)
di: Qian, Chen, et al.
Pubblicazione: (2024)
Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?
di: Chen, Guanxu, et al.
Pubblicazione: (2026)
di: Chen, Guanxu, et al.
Pubblicazione: (2026)
Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models
di: Yang, Junyao, et al.
Pubblicazione: (2026)
di: Yang, Junyao, et al.
Pubblicazione: (2026)
Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey
di: Dang, Yunkai, et al.
Pubblicazione: (2024)
di: Dang, Yunkai, et al.
Pubblicazione: (2024)
Rethinking 1-bit Optimization Leveraging Pre-trained Large Language Models
di: Tu, Zhijun, et al.
Pubblicazione: (2025)
di: Tu, Zhijun, et al.
Pubblicazione: (2025)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
di: Ma, Qianli, et al.
Pubblicazione: (2025)
di: Ma, Qianli, et al.
Pubblicazione: (2025)
Rethinking Entropy Regularization in Large Reasoning Models
di: Jiang, Yuxian, et al.
Pubblicazione: (2025)
di: Jiang, Yuxian, et al.
Pubblicazione: (2025)
Towards Effective and Efficient Continual Pre-training of Large Language Models
di: Chen, Jie, et al.
Pubblicazione: (2024)
di: Chen, Jie, et al.
Pubblicazione: (2024)
OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
TrustLLM: Trustworthiness in Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Efficient Continual Pre-training for Building Domain Specific Large Language Models
di: Xie, Yong, et al.
Pubblicazione: (2023)
di: Xie, Yong, et al.
Pubblicazione: (2023)
MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
di: Fu, Wenjie, et al.
Pubblicazione: (2024)
RegMix: Data Mixture as Regression for Language Model Pre-training
di: Liu, Qian, et al.
Pubblicazione: (2024)
di: Liu, Qian, et al.
Pubblicazione: (2024)
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
Masked Structural Growth for 2x Faster Language Model Pre-training
di: Yao, Yiqun, et al.
Pubblicazione: (2023)
di: Yao, Yiqun, et al.
Pubblicazione: (2023)
Pre-trained Large Language Models for Financial Sentiment Analysis
di: Luo, Wei, et al.
Pubblicazione: (2024)
di: Luo, Wei, et al.
Pubblicazione: (2024)
Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
di: Chen, Guanxu, et al.
Pubblicazione: (2025)
Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey
di: Ni, Bo, et al.
Pubblicazione: (2025)
di: Ni, Bo, et al.
Pubblicazione: (2025)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
di: Zheng, Junhao, et al.
Pubblicazione: (2023)
di: Zheng, Junhao, et al.
Pubblicazione: (2023)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
di: Luo, Gen, et al.
Pubblicazione: (2024)
di: Luo, Gen, et al.
Pubblicazione: (2024)
Evaluating Discourse Cohesion in Pre-trained Language Models
di: He, Jie, et al.
Pubblicazione: (2025)
di: He, Jie, et al.
Pubblicazione: (2025)
G-MAP: General Memory-Augmented Pre-trained Language Model for Domain Tasks
di: Wan, Zhongwei, et al.
Pubblicazione: (2022)
di: Wan, Zhongwei, et al.
Pubblicazione: (2022)
Machine Unlearning of Pre-trained Large Language Models
di: Yao, Jin, et al.
Pubblicazione: (2024)
di: Yao, Jin, et al.
Pubblicazione: (2024)
Cross-layer Attention Sharing for Pre-trained Large Language Models
di: Mu, Yongyu, et al.
Pubblicazione: (2024)
di: Mu, Yongyu, et al.
Pubblicazione: (2024)
Eliciting Trustworthiness Priors of Large Language Models via Economic Games
di: Yan, Siyu, et al.
Pubblicazione: (2026)
di: Yan, Siyu, et al.
Pubblicazione: (2026)
DataMan: Data Manager for Pre-training Large Language Models
di: Peng, Ru, et al.
Pubblicazione: (2025)
di: Peng, Ru, et al.
Pubblicazione: (2025)
The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models
di: Liu, Yan, et al.
Pubblicazione: (2024)
di: Liu, Yan, et al.
Pubblicazione: (2024)
TRELM: Towards Robust and Efficient Pre-training for Knowledge-Enhanced Language Models
di: Yan, Junbing, et al.
Pubblicazione: (2024)
di: Yan, Junbing, et al.
Pubblicazione: (2024)
SongSage: A Large Musical Language Model with Lyric Generative Pre-training
di: Guo, Jiani, et al.
Pubblicazione: (2026)
di: Guo, Jiani, et al.
Pubblicazione: (2026)
MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
di: Zhang, Yichi, et al.
Pubblicazione: (2024)
Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs
di: Ma, Jie, et al.
Pubblicazione: (2025)
di: Ma, Jie, et al.
Pubblicazione: (2025)
Probing Language Models for Pre-training Data Detection
di: Liu, Zhenhua, et al.
Pubblicazione: (2024)
di: Liu, Zhenhua, et al.
Pubblicazione: (2024)
On the Blessing of Pre-training in Weak-to-Strong Generalization
di: Yao, Wei, et al.
Pubblicazione: (2026)
di: Yao, Wei, et al.
Pubblicazione: (2026)
Pre-training Distillation for Large Language Models: A Design Space Exploration
di: Peng, Hao, et al.
Pubblicazione: (2024)
di: Peng, Hao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
REEF: Representation Encoding Fingerprints for Large Language Models
di: Zhang, Jie, et al.
Pubblicazione: (2024) -
The Better Angels of Machine Personality: How Personality Relates to LLM Safety
di: Zhang, Jie, et al.
Pubblicazione: (2024) -
Demystifying Reasoning Dynamics with Mutual Information: Thinking Tokens are Information Peaks in LLM Reasoning
di: Qian, Chen, et al.
Pubblicazione: (2025) -
Model Merging in Pre-training of Large Language Models
di: Li, Yunshui, et al.
Pubblicazione: (2025) -
ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
di: Yang, Junyao, et al.
Pubblicazione: (2026)