Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Chenxing, Wang, Hong, He, Ying, Yu, Fei, Shu, Yao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Flexora: Flexible Low Rank Adaptation for Large Language Models
di: Wei, Chenxing, et al.
Pubblicazione: (2024)
di: Wei, Chenxing, et al.
Pubblicazione: (2024)
ReDit: Reward Dithering for Improved LLM Policy Optimization
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation
di: Wei, Chenxing, et al.
Pubblicazione: (2026)
di: Wei, Chenxing, et al.
Pubblicazione: (2026)
PAFT: Prompt-Agnostic Fine-Tuning
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following
di: He, Yun, et al.
Pubblicazione: (2024)
di: He, Yun, et al.
Pubblicazione: (2024)
FlowKV: Enhancing Multi-Turn Conversational Coherence in LLMs via Isolated Key-Value Cache Management
di: Liu, Xiang, et al.
Pubblicazione: (2025)
di: Liu, Xiang, et al.
Pubblicazione: (2025)
Thinker: Training LLMs in Hierarchical Thinking for Deep Search via Multi-Turn Interaction
di: Xu, Jun, et al.
Pubblicazione: (2025)
di: Xu, Jun, et al.
Pubblicazione: (2025)
Unsupervised Layer-Wise Dynamic Test Time Adaptation for LLMs
di: Xu, Longhuan, et al.
Pubblicazione: (2026)
di: Xu, Longhuan, et al.
Pubblicazione: (2026)
Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation
di: Liu, Geng, et al.
Pubblicazione: (2026)
di: Liu, Geng, et al.
Pubblicazione: (2026)
Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
di: Wang, Guoqing, et al.
Pubblicazione: (2025)
di: Wang, Guoqing, et al.
Pubblicazione: (2025)
RMTBench: Benchmarking LLMs Through Multi-Turn User-Centric Role-Playing
di: Xiang, Hao, et al.
Pubblicazione: (2025)
di: Xiang, Hao, et al.
Pubblicazione: (2025)
MM-LLMs: Recent Advances in MultiModal Large Language Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
di: Zhang, Duzhen, et al.
Pubblicazione: (2024)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
di: Li, Yubo, et al.
Pubblicazione: (2025)
di: Li, Yubo, et al.
Pubblicazione: (2025)
When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction
di: Dongre, Vardhan, et al.
Pubblicazione: (2026)
di: Dongre, Vardhan, et al.
Pubblicazione: (2026)
CA-BERT: Leveraging Context Awareness for Enhanced Multi-Turn Chat Interaction
di: Liu, Minghao, et al.
Pubblicazione: (2024)
di: Liu, Minghao, et al.
Pubblicazione: (2024)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
di: Wang, Yueqian, et al.
Pubblicazione: (2025)
di: Wang, Yueqian, et al.
Pubblicazione: (2025)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
di: Hu, Yuanzhe, et al.
Pubblicazione: (2025)
di: Hu, Yuanzhe, et al.
Pubblicazione: (2025)
Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative Generation
di: Shen, Hanwen, et al.
Pubblicazione: (2026)
di: Shen, Hanwen, et al.
Pubblicazione: (2026)
Auditing Support Strategies in LLMs through Grounded Multi-Turn Social Simulation
di: Star, Michelle, et al.
Pubblicazione: (2026)
di: Star, Michelle, et al.
Pubblicazione: (2026)
LLMs Get Lost In Multi-Turn Conversation
di: Laban, Philippe, et al.
Pubblicazione: (2025)
di: Laban, Philippe, et al.
Pubblicazione: (2025)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
di: Yu, Erxin, et al.
Pubblicazione: (2024)
di: Yu, Erxin, et al.
Pubblicazione: (2024)
Evaluating Test-Time Scaling LLMs for Legal Reasoning: OpenAI o1, DeepSeek-R1, and Beyond
di: Hu, Yinghao, et al.
Pubblicazione: (2025)
di: Hu, Yinghao, et al.
Pubblicazione: (2025)
RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents
di: Li, Mingchen, et al.
Pubblicazione: (2026)
di: Li, Mingchen, et al.
Pubblicazione: (2026)
A Survey on Multi-Turn Interaction Capabilities of Large Language Models
di: Zhang, Chen, et al.
Pubblicazione: (2025)
di: Zhang, Chen, et al.
Pubblicazione: (2025)
Dynamic Context Tuning for Retrieval-Augmented Generation: Enhancing Multi-Turn Planning and Tool Adaptation
di: Soni, Jubin Abhishek, et al.
Pubblicazione: (2025)
di: Soni, Jubin Abhishek, et al.
Pubblicazione: (2025)
Pluralistic Behavior Suite: Stress-Testing Multi-Turn Adherence to Custom Behavioral Policies
di: Varshney, Prasoon, et al.
Pubblicazione: (2025)
di: Varshney, Prasoon, et al.
Pubblicazione: (2025)
ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
di: Zeng, Xingshan, et al.
Pubblicazione: (2025)
ICPO: Illocution-Calibrated Policy Optimization for Multi-Turn Conversation
di: Wang, Zhebo, et al.
Pubblicazione: (2026)
di: Wang, Zhebo, et al.
Pubblicazione: (2026)
Dynamic Prompt Fusion for Multi-Task and Cross-Domain Adaptation in LLMs
di: Hu, Xin, et al.
Pubblicazione: (2025)
di: Hu, Xin, et al.
Pubblicazione: (2025)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
di: Liang, Xiao, et al.
Pubblicazione: (2026)
di: Liang, Xiao, et al.
Pubblicazione: (2026)
MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time
di: Phan, Peter, et al.
Pubblicazione: (2025)
di: Phan, Peter, et al.
Pubblicazione: (2025)
Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
di: Ding, Yifeng, et al.
Pubblicazione: (2025)
Found in Conversation: LLMs Teach Themselves to Close the Multi-Turn Gap
di: Chen, Tianlang, et al.
Pubblicazione: (2026)
di: Chen, Tianlang, et al.
Pubblicazione: (2026)
MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
di: Singh, Jyotika, et al.
Pubblicazione: (2026)
Self-Reflective Generation at Test Time
di: Mu, Jian, et al.
Pubblicazione: (2025)
di: Mu, Jian, et al.
Pubblicazione: (2025)
Prompt Highlighter: Interactive Control for Multi-Modal LLMs
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
di: Zhang, Yuechen, et al.
Pubblicazione: (2023)
PANDA: Preference Adaptation for Enhancing Domain-Specific Abilities of LLMs
di: Liu, An, et al.
Pubblicazione: (2024)
di: Liu, An, et al.
Pubblicazione: (2024)
Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs
di: Hong, Yining, et al.
Pubblicazione: (2026)
di: Hong, Yining, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Flexora: Flexible Low Rank Adaptation for Large Language Models
di: Wei, Chenxing, et al.
Pubblicazione: (2024) -
ReDit: Reward Dithering for Improved LLM Policy Optimization
di: Wei, Chenxing, et al.
Pubblicazione: (2025) -
Words & Weights: Streamlining Multi-Turn Interactions via Co-Adaptation
di: Wei, Chenxing, et al.
Pubblicazione: (2026) -
PAFT: Prompt-Agnostic Fine-Tuning
di: Wei, Chenxing, et al.
Pubblicazione: (2025) -
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)