Inconsistent dialogue responses and how to recover from them
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Mian, Jin, Lifeng, Song, Linfeng, Mi, Haitao, Yu, Dong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
par: Das, Souvik, et autres
Publié: (2024)
par: Das, Souvik, et autres
Publié: (2024)
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
par: Li, Xiangci, et autres
Publié: (2024)
par: Li, Xiangci, et autres
Publié: (2024)
Collaborative decoding of critical tokens for boosting factuality of large language models
par: Jin, Lifeng, et autres
Publié: (2024)
par: Jin, Lifeng, et autres
Publié: (2024)
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
par: Yu, Dian, et autres
Publié: (2024)
par: Yu, Dian, et autres
Publié: (2024)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
par: Zhang, Xiaoying, et autres
Publié: (2024)
par: Zhang, Xiaoying, et autres
Publié: (2024)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
par: Yu, Dian, et autres
Publié: (2025)
par: Yu, Dian, et autres
Publié: (2025)
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
par: Liang, Zhenwen, et autres
Publié: (2025)
par: Liang, Zhenwen, et autres
Publié: (2025)
Teaching LLMs to Refine with Tools
par: Yu, Dian, et autres
Publié: (2024)
par: Yu, Dian, et autres
Publié: (2024)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
par: Su, Yi, et autres
Publié: (2025)
par: Su, Yi, et autres
Publié: (2025)
Verified Critical Step Optimization for LLM Agents
par: Li, Mukai, et autres
Publié: (2026)
par: Li, Mukai, et autres
Publié: (2026)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
par: Wang, Xiyao, et autres
Publié: (2024)
par: Wang, Xiyao, et autres
Publié: (2024)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
par: Wang, Ante, et autres
Publié: (2025)
par: Wang, Ante, et autres
Publié: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
par: Zhang, Yuheng, et autres
Publié: (2025)
par: Zhang, Yuheng, et autres
Publié: (2025)
HunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Proving
par: Li, Yang, et autres
Publié: (2024)
par: Li, Yang, et autres
Publié: (2024)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
par: Li, Mukai, et autres
Publié: (2025)
par: Li, Mukai, et autres
Publié: (2025)
HDFlow: Enhancing LLM Complex Problem-Solving with Hybrid Thinking and Dynamic Workflows
par: Yao, Wenlin, et autres
Publié: (2024)
par: Yao, Wenlin, et autres
Publié: (2024)
LiteSearch: Efficacious Tree Search for LLM
par: Wang, Ante, et autres
Publié: (2024)
par: Wang, Ante, et autres
Publié: (2024)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
par: Zhou, Yujun, et autres
Publié: (2025)
par: Zhou, Yujun, et autres
Publié: (2025)
Strong hallucinations from negation and how to fix them
par: Asher, Nicholas, et autres
Publié: (2024)
par: Asher, Nicholas, et autres
Publié: (2024)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
par: Zhang, Yuheng, et autres
Publié: (2024)
par: Zhang, Yuheng, et autres
Publié: (2024)
Research on emotionally intelligent dialogue generation based on automatic dialogue system
par: Wang, Jin, et autres
Publié: (2024)
par: Wang, Jin, et autres
Publié: (2024)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
par: Ma, Junyu, et autres
Publié: (2025)
par: Ma, Junyu, et autres
Publié: (2025)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
par: Fang, Tianqing, et autres
Publié: (2025)
par: Fang, Tianqing, et autres
Publié: (2025)
What are human values, and how do we align AI to them?
par: Klingefjord, Oliver, et autres
Publié: (2024)
par: Klingefjord, Oliver, et autres
Publié: (2024)
Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs
par: Chen, Xingyu, et autres
Publié: (2024)
par: Chen, Xingyu, et autres
Publié: (2024)
Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs
par: Wang, Yue, et autres
Publié: (2025)
par: Wang, Yue, et autres
Publié: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
par: Lu, Sidi, et autres
Publié: (2026)
par: Lu, Sidi, et autres
Publié: (2026)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
par: Dai, Runpeng, et autres
Publié: (2025)
par: Dai, Runpeng, et autres
Publié: (2025)
Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens
par: Ouyang, Xu, et autres
Publié: (2024)
par: Ouyang, Xu, et autres
Publié: (2024)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
par: Zhang, Zhisong, et autres
Publié: (2025)
par: Zhang, Zhisong, et autres
Publié: (2025)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
par: Panaganti, Kishan, et autres
Publié: (2026)
par: Panaganti, Kishan, et autres
Publié: (2026)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
par: Zhang, Ziyin, et autres
Publié: (2025)
par: Zhang, Ziyin, et autres
Publié: (2025)
Scaling Synthetic Data Creation with 1,000,000,000 Personas
par: Ge, Tao, et autres
Publié: (2024)
par: Ge, Tao, et autres
Publié: (2024)
Improved Evidence Extraction and Metrics for Document Inconsistency Detection with LLMs
par: Tan, Nelvin, et autres
Publié: (2026)
par: Tan, Nelvin, et autres
Publié: (2026)
Misleading through Inconsistency: A Benchmark for Political Inconsistencies Detection
par: Sagimbayeva, Nursulu, et autres
Publié: (2025)
par: Sagimbayeva, Nursulu, et autres
Publié: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
Documents similaires
-
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
par: Das, Souvik, et autres
Publié: (2024) -
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
par: Li, Xiangci, et autres
Publié: (2024) -
Collaborative decoding of critical tokens for boosting factuality of large language models
par: Jin, Lifeng, et autres
Publié: (2024) -
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
par: Tian, Ye, et autres
Publié: (2024) -
Self-Consistency Boosts Calibration for Math Reasoning
par: Wang, Ante, et autres
Publié: (2024)