Meta-Thinking in LLMs via Multi-Agent Reinforcement Learning: A Survey
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bilal, Ahsan, Mohsin, Muhammad Ahmed, Umer, Muhammad, Bangash, Muhammad Awais Khan, Jamshed, Muhammad Ali |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Meta-Reinforcement Learning for Fast and Data-Efficient Spectrum Allocation in Dynamic Wireless Networks
par: Giwa, Oluwaseyi, et autres
Publié: (2025)
par: Giwa, Oluwaseyi, et autres
Publié: (2025)
Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training
par: Hassan, Muhammad Taimoor, et autres
Publié: (2026)
par: Hassan, Muhammad Taimoor, et autres
Publié: (2026)
Continuous-Utility Direct Preference Optimization
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026)
Resource Allocation for RIS-Assisted CoMP-NOMA Networks using Reinforcement Learning
par: Umer, Muhammad, et autres
Publié: (2025)
par: Umer, Muhammad, et autres
Publié: (2025)
Continual Learning for Wireless Channel Prediction
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
General Preference Reinforcement Learning
par: Umer, Muhammad, et autres
Publié: (2026)
par: Umer, Muhammad, et autres
Publié: (2026)
What If We Allocate Test-Time Compute Adaptively?
par: Bilal, Ahsan, et autres
Publié: (2026)
par: Bilal, Ahsan, et autres
Publié: (2026)
Can LLMs Explain Themselves Counterfactually?
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
par: Dehghanighobadi, Zahra, et autres
Publié: (2025)
6G Twin: Hybrid Gaussian Radio Fields for Channel Estimation and Non-Linear Precoder Design for Radio Access Networks
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
Epistemic Uncertainty for Test-Time Discovery
par: Riaz, Kainat, et autres
Publié: (2026)
par: Riaz, Kainat, et autres
Publié: (2026)
Channel Prediction under Network Distribution Shift Using Continual Learning-based Loss Regularization
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
LLMs for Explainable AI: A Comprehensive Survey
par: Bilal, Ahsan, et autres
Publié: (2025)
par: Bilal, Ahsan, et autres
Publié: (2025)
On the Fundamental Limits of LLMs at Scale
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs
par: Said, Muhammad Abdullahi, et autres
Publié: (2025)
par: Said, Muhammad Abdullahi, et autres
Publié: (2025)
Transformer-Based Sparse CSI Estimation for Non-Stationary Channels
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
Natural Language Processing for Analyzing Electronic Health Records and Clinical Notes in Cancer Research: A Review
par: Bilal, Muhammad, et autres
Publié: (2024)
par: Bilal, Muhammad, et autres
Publié: (2024)
Conditional Prior-based Non-stationary Channel Estimation Using Accelerated Diffusion Models
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2025)
A Multi-Strategy Approach for AI-Generated Text Detection
par: Zain, Ali, et autres
Publié: (2025)
par: Zain, Ali, et autres
Publié: (2025)
Unification of Balti and trans-border sister dialects in the essence of LLMs and AI Technology
par: Sharif, Muhammad, et autres
Publié: (2024)
par: Sharif, Muhammad, et autres
Publié: (2024)
SC-Phi2: A Fine-tuned Small Language Model for StarCraft II Macromanagement Tasks
par: Khan, Muhammad Junaid, et autres
Publié: (2024)
par: Khan, Muhammad Junaid, et autres
Publié: (2024)
$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models
par: Bilal, Ahsan, et autres
Publié: (2026)
par: Bilal, Ahsan, et autres
Publié: (2026)
Position is Power: System Prompts as a Mechanism of Bias in Large Language Models (LLMs)
par: Neumann, Anna, et autres
Publié: (2025)
par: Neumann, Anna, et autres
Publié: (2025)
SEMFED: Semantic-Aware Resource-Efficient Federated Learning for Heterogeneous NLP Tasks
par: Hussain, Sajid, et autres
Publié: (2025)
par: Hussain, Sajid, et autres
Publié: (2025)
The Impact of Inference Acceleration on Bias of LLMs
par: Kirsten, Elisabeth, et autres
Publié: (2024)
par: Kirsten, Elisabeth, et autres
Publié: (2024)
Harnessing Multi-Agent LLMs for Complex Engineering Problem-Solving: A Framework for Senior Design Projects
par: Mushtaq, Abdullah, et autres
Publié: (2025)
par: Mushtaq, Abdullah, et autres
Publié: (2025)
Emotion-Aware Embedding Fusion in LLMs (Flan-T5, LLAMA 2, DeepSeek-R1, and ChatGPT 4) for Intelligent Response Generation
par: Rasool, Abdur, et autres
Publié: (2024)
par: Rasool, Abdur, et autres
Publié: (2024)
TCAR-Gen: Temporal Graph Retrieval with Evidence Fusion for Knowledge-Grounded Generation
par: Nasir, Sidra, et autres
Publié: (2026)
par: Nasir, Sidra, et autres
Publié: (2026)
GeoResponder: Towards Building Geospatial LLMs for Time-Critical Disaster Response
par: Zguir, Ahmed El Fekih, et autres
Publié: (2025)
par: Zguir, Ahmed El Fekih, et autres
Publié: (2025)
Comparative Analysis of 47 Context-Based Question Answer Models Across 8 Diverse Datasets
par: Muneeb, Muhammad, et autres
Publié: (2025)
par: Muneeb, Muhammad, et autres
Publié: (2025)
On the Adoption of AI Coding Agents in Open-source Android and iOS Development
par: Khan, Muhammad Ahmad, et autres
Publié: (2026)
par: Khan, Muhammad Ahmad, et autres
Publié: (2026)
On Early Detection of Hallucinations in Factual Question Answering
par: Snyder, Ben, et autres
Publié: (2023)
par: Snyder, Ben, et autres
Publié: (2023)
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
par: Alkaeed, Mahdi, et autres
Publié: (2026)
par: Alkaeed, Mahdi, et autres
Publié: (2026)
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
par: Khan, Ufaq, et autres
Publié: (2026)
par: Khan, Ufaq, et autres
Publié: (2026)
Enhancing Multi-Class Disease Classification: Neoplasms, Cardiovascular, Nervous System, and Digestive Disorders Using Advanced LLMs
par: Karim, Ahmed Akib Jawad, et autres
Publié: (2024)
par: Karim, Ahmed Akib Jawad, et autres
Publié: (2024)
Sacred or Secular? Religious Bias in AI-Generated Financial Advice
par: Khan, Muhammad Salar, et autres
Publié: (2025)
par: Khan, Muhammad Salar, et autres
Publié: (2025)
Sustainable Digitalization of Business with Multi-Agent RAG and LLM
par: Arslan, Muhammad, et autres
Publié: (2025)
par: Arslan, Muhammad, et autres
Publié: (2025)
Multi Class Depression Detection Through Tweets using Artificial Intelligence
par: Nusrat, Muhammad Osama, et autres
Publié: (2024)
par: Nusrat, Muhammad Osama, et autres
Publié: (2024)
UrduLM: A Resource-Efficient Monolingual Urdu Language Model
par: Ali, Syed Muhammad, et autres
Publié: (2026)
par: Ali, Syed Muhammad, et autres
Publié: (2026)
MoRAL: MoE Augmented LoRA for LLMs' Lifelong Learning
par: Yang, Shu, et autres
Publié: (2024)
par: Yang, Shu, et autres
Publié: (2024)
Documents similaires
-
Meta-Reinforcement Learning for Fast and Data-Efficient Spectrum Allocation in Dynamic Wireless Networks
par: Giwa, Oluwaseyi, et autres
Publié: (2025) -
Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026) -
Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training
par: Hassan, Muhammad Taimoor, et autres
Publié: (2026) -
Continuous-Utility Direct Preference Optimization
par: Mohsin, Muhammad Ahmed, et autres
Publié: (2026) -
Resource Allocation for RIS-Assisted CoMP-NOMA Networks using Reinforcement Learning
par: Umer, Muhammad, et autres
Publié: (2025)