Unrewarded Exploration in Large Language Models Reveals Latent Learning from Psychology
Fuente:
arXiv
Salvato in:
| Autori principali: | Xiong, Jian, Zhou, Jingbo, Zhou, Zihan, Xiao, Yixiong, Zhang, Le, Ye, Jingyong, Qian, Rui, Zhou, Yang, Dou, Dejing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
di: Xiong, Jian, et al.
Pubblicazione: (2025)
di: Xiong, Jian, et al.
Pubblicazione: (2025)
SDWPF: A Dataset for Spatial Dynamic Wind Power Forecasting Challenge at KDD Cup 2022
di: Zhou, Jingbo, et al.
Pubblicazione: (2022)
di: Zhou, Jingbo, et al.
Pubblicazione: (2022)
TimeFound: A Foundation Model for Time Series Forecasting
di: Xiao, Congxi, et al.
Pubblicazione: (2025)
di: Xiao, Congxi, et al.
Pubblicazione: (2025)
PAMNet: Cycle-aware Phase-Amplitude Modulation Network for Multivariate Time Series Forecasting
di: Zhou, Yingbo, et al.
Pubblicazione: (2026)
di: Zhou, Yingbo, et al.
Pubblicazione: (2026)
Federated Learning of Large Language Models with Parameter-Efficient Prompt Tuning and Adaptive Optimization
di: Che, Tianshi, et al.
Pubblicazione: (2023)
di: Che, Tianshi, et al.
Pubblicazione: (2023)
Fisher Information-based Efficient Curriculum Federated Learning with Large Language Models
di: Liu, Ji, et al.
Pubblicazione: (2024)
di: Liu, Ji, et al.
Pubblicazione: (2024)
PAMod: Modeling Cyclical Shifts via Phase-Amplitude Modulation for Non-stationary Time Series Forecasting
di: Zhou, Yingbo, et al.
Pubblicazione: (2026)
di: Zhou, Yingbo, et al.
Pubblicazione: (2026)
Efficient Federated Learning with Heterogeneous Data and Adaptive Dropout
di: Liu, Ji, et al.
Pubblicazione: (2025)
di: Liu, Ji, et al.
Pubblicazione: (2025)
Enhancing Trust and Privacy in Distributed Networks: A Comprehensive Survey on Blockchain-based Federated Learning
di: Liu, Ji, et al.
Pubblicazione: (2024)
di: Liu, Ji, et al.
Pubblicazione: (2024)
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
di: Huo, Yifu, et al.
Pubblicazione: (2026)
di: Huo, Yifu, et al.
Pubblicazione: (2026)
Efficient Asynchronous Federated Learning with Sparsification and Quantization
di: Jia, Juncheng, et al.
Pubblicazione: (2023)
di: Jia, Juncheng, et al.
Pubblicazione: (2023)
Efficient Federated Learning with Timely Update Dissemination
di: Jia, Juncheng, et al.
Pubblicazione: (2025)
di: Jia, Juncheng, et al.
Pubblicazione: (2025)
Foundations of Large Language Models
di: Xiao, Tong, et al.
Pubblicazione: (2025)
di: Xiao, Tong, et al.
Pubblicazione: (2025)
Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
di: Tan, Wenhui, et al.
Pubblicazione: (2026)
Reasoning to Attend: Try to Understand How <SEG> Token Works
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
CHAT: Beyond Contrastive Graph Transformer for Link Prediction in Heterogeneous Networks
di: Zhang, Shengming, et al.
Pubblicazione: (2025)
di: Zhang, Shengming, et al.
Pubblicazione: (2025)
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
di: Qian, Rui, et al.
Pubblicazione: (2026)
di: Qian, Rui, et al.
Pubblicazione: (2026)
Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
di: Fang, Yixiong, et al.
Pubblicazione: (2024)
di: Fang, Yixiong, et al.
Pubblicazione: (2024)
Efficient Federated Learning Using Dynamic Update and Adaptive Pruning with Momentum on Shared Server Data
di: Liu, Ji, et al.
Pubblicazione: (2024)
di: Liu, Ji, et al.
Pubblicazione: (2024)
Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective
di: Mao, Liyuan, et al.
Pubblicazione: (2026)
di: Mao, Liyuan, et al.
Pubblicazione: (2026)
QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language Models
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
Learning to Decouple Complex Systems
di: Zhou, Zihan, et al.
Pubblicazione: (2023)
di: Zhou, Zihan, et al.
Pubblicazione: (2023)
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models
di: Zhang, Shimin, et al.
Pubblicazione: (2025)
di: Zhang, Shimin, et al.
Pubblicazione: (2025)
LEPO: Latent Reasoning Policy Optimization for Large Language Models
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
di: Zhou, Yuyan, et al.
Pubblicazione: (2026)
LoReC: Rethinking Large Language Models for Graph Data Analysis
di: Zhan, Hongyu, et al.
Pubblicazione: (2026)
di: Zhan, Hongyu, et al.
Pubblicazione: (2026)
Zero-shot Load Forecasting for Integrated Energy Systems: A Large Language Model-based Framework with Multi-task Learning
di: Li, Jiaheng, et al.
Pubblicazione: (2025)
di: Li, Jiaheng, et al.
Pubblicazione: (2025)
Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models
di: Wu, Jialin, et al.
Pubblicazione: (2026)
di: Wu, Jialin, et al.
Pubblicazione: (2026)
Large Language Model Compression with Global Rank and Sparsity Optimization
di: Zhou, Changhai, et al.
Pubblicazione: (2025)
di: Zhou, Changhai, et al.
Pubblicazione: (2025)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
di: Ye, Kai, et al.
Pubblicazione: (2025)
di: Ye, Kai, et al.
Pubblicazione: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
di: Yang, Qian, et al.
Pubblicazione: (2024)
di: Yang, Qian, et al.
Pubblicazione: (2024)
Regressor-guided Diffusion Model for De Novo Peptide Sequencing with Explicit Mass Control
di: Chen, Shaorong, et al.
Pubblicazione: (2026)
di: Chen, Shaorong, et al.
Pubblicazione: (2026)
Large Language Models as Optimizers
di: Yang, Chengrun, et al.
Pubblicazione: (2023)
di: Yang, Chengrun, et al.
Pubblicazione: (2023)
Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models
di: Zhou, Zhanke, et al.
Pubblicazione: (2025)
di: Zhou, Zhanke, et al.
Pubblicazione: (2025)
Embedding Enhancement via Fine-Tuned Language Models for Learner-Item Cognitive Modeling
di: Liu, Yuanhao, et al.
Pubblicazione: (2026)
di: Liu, Yuanhao, et al.
Pubblicazione: (2026)
UGround: Towards Unified Visual Grounding with Unrolled Transformers
di: Qian, Rui, et al.
Pubblicazione: (2025)
di: Qian, Rui, et al.
Pubblicazione: (2025)
Delve into Base-Novel Confusion: Redundancy Exploration for Few-Shot Class-Incremental Learning
di: Zhou, Haichen, et al.
Pubblicazione: (2024)
di: Zhou, Haichen, et al.
Pubblicazione: (2024)
Do Large Language Models Truly Grasp Mathematics? An Empirical Exploration From Cognitive Psychology
di: Xie, Wei, et al.
Pubblicazione: (2024)
di: Xie, Wei, et al.
Pubblicazione: (2024)
Attribution-Guided Continual Learning for Large Language Models
di: Liu, Yazheng, et al.
Pubblicazione: (2026)
di: Liu, Yazheng, et al.
Pubblicazione: (2026)
Privacy-preserving Decision-focused Learning for Multi-energy Systems
di: Zhou, Yangze, et al.
Pubblicazione: (2025)
di: Zhou, Yangze, et al.
Pubblicazione: (2025)
Latent Knowledge Scalpel: Precise and Massive Knowledge Editing for Large Language Models
di: Liu, Xin, et al.
Pubblicazione: (2025)
di: Liu, Xin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin
di: Xiong, Jian, et al.
Pubblicazione: (2025) -
SDWPF: A Dataset for Spatial Dynamic Wind Power Forecasting Challenge at KDD Cup 2022
di: Zhou, Jingbo, et al.
Pubblicazione: (2022) -
TimeFound: A Foundation Model for Time Series Forecasting
di: Xiao, Congxi, et al.
Pubblicazione: (2025) -
PAMNet: Cycle-aware Phase-Amplitude Modulation Network for Multivariate Time Series Forecasting
di: Zhou, Yingbo, et al.
Pubblicazione: (2026) -
Federated Learning of Large Language Models with Parameter-Efficient Prompt Tuning and Adaptive Optimization
di: Che, Tianshi, et al.
Pubblicazione: (2023)