Inconsistent dialogue responses and how to recover from them
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Mian, Jin, Lifeng, Song, Linfeng, Mi, Haitao, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
por: Das, Souvik, et al.
Publicado: (2024)
por: Das, Souvik, et al.
Publicado: (2024)
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
por: Li, Xiangci, et al.
Publicado: (2024)
por: Li, Xiangci, et al.
Publicado: (2024)
Collaborative decoding of critical tokens for boosting factuality of large language models
por: Jin, Lifeng, et al.
Publicado: (2024)
por: Jin, Lifeng, et al.
Publicado: (2024)
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
por: Tian, Ye, et al.
Publicado: (2024)
por: Tian, Ye, et al.
Publicado: (2024)
Self-Consistency Boosts Calibration for Math Reasoning
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models
por: Yu, Dian, et al.
Publicado: (2024)
por: Yu, Dian, et al.
Publicado: (2024)
Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation
por: Zhang, Xiaoying, et al.
Publicado: (2024)
por: Zhang, Xiaoying, et al.
Publicado: (2024)
Every Question Has Its Own Value: Reinforcement Learning with Explicit Human Values
por: Yu, Dian, et al.
Publicado: (2025)
por: Yu, Dian, et al.
Publicado: (2025)
CLUE: Non-parametric Verification from Experience via Hidden-State Clustering
por: Liang, Zhenwen, et al.
Publicado: (2025)
por: Liang, Zhenwen, et al.
Publicado: (2025)
Teaching LLMs to Refine with Tools
por: Yu, Dian, et al.
Publicado: (2024)
por: Yu, Dian, et al.
Publicado: (2024)
Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
por: Su, Yi, et al.
Publicado: (2025)
por: Su, Yi, et al.
Publicado: (2025)
Verified Critical Step Optimization for LLM Agents
por: Li, Mukai, et al.
Publicado: (2026)
por: Li, Mukai, et al.
Publicado: (2026)
Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
por: Wang, Ante, et al.
Publicado: (2025)
por: Wang, Ante, et al.
Publicado: (2025)
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
por: Zhang, Yuheng, et al.
Publicado: (2025)
por: Zhang, Yuheng, et al.
Publicado: (2025)
HunyuanProver: A Scalable Data Synthesis Framework and Guided Tree Search for Automated Theorem Proving
por: Li, Yang, et al.
Publicado: (2024)
por: Li, Yang, et al.
Publicado: (2024)
EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving
por: Li, Mukai, et al.
Publicado: (2025)
por: Li, Mukai, et al.
Publicado: (2025)
HDFlow: Enhancing LLM Complex Problem-Solving with Hybrid Thinking and Dynamic Workflows
por: Yao, Wenlin, et al.
Publicado: (2024)
por: Yao, Wenlin, et al.
Publicado: (2024)
LiteSearch: Efficacious Tree Search for LLM
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation
por: Zhou, Yujun, et al.
Publicado: (2025)
por: Zhou, Yujun, et al.
Publicado: (2025)
Strong hallucinations from negation and how to fix them
por: Asher, Nicholas, et al.
Publicado: (2024)
por: Asher, Nicholas, et al.
Publicado: (2024)
Iterative Nash Policy Optimization: Aligning LLMs with General Preferences via No-Regret Learning
por: Zhang, Yuheng, et al.
Publicado: (2024)
por: Zhang, Yuheng, et al.
Publicado: (2024)
Research on emotionally intelligent dialogue generation based on automatic dialogue system
por: Wang, Jin, et al.
Publicado: (2024)
por: Wang, Jin, et al.
Publicado: (2024)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
por: Ma, Junyu, et al.
Publicado: (2025)
por: Ma, Junyu, et al.
Publicado: (2025)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
What are human values, and how do we align AI to them?
por: Klingefjord, Oliver, et al.
Publicado: (2024)
por: Klingefjord, Oliver, et al.
Publicado: (2024)
Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs
por: Chen, Xingyu, et al.
Publicado: (2024)
por: Chen, Xingyu, et al.
Publicado: (2024)
Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs
por: Wang, Yue, et al.
Publicado: (2025)
por: Wang, Yue, et al.
Publicado: (2025)
Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories
por: Lu, Sidi, et al.
Publicado: (2026)
por: Lu, Sidi, et al.
Publicado: (2026)
CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models
por: Dai, Runpeng, et al.
Publicado: (2025)
por: Dai, Runpeng, et al.
Publicado: (2025)
Low-Bit Quantization Favors Undertrained LLMs: Scaling Laws for Quantized LLMs with 100T Training Tokens
por: Ouyang, Xu, et al.
Publicado: (2024)
por: Ouyang, Xu, et al.
Publicado: (2024)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
por: Zhang, Zhisong, et al.
Publicado: (2025)
por: Zhang, Zhisong, et al.
Publicado: (2025)
Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning
por: Panaganti, Kishan, et al.
Publicado: (2026)
por: Panaganti, Kishan, et al.
Publicado: (2026)
DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning
por: Zhang, Ziyin, et al.
Publicado: (2025)
por: Zhang, Ziyin, et al.
Publicado: (2025)
Scaling Synthetic Data Creation with 1,000,000,000 Personas
por: Ge, Tao, et al.
Publicado: (2024)
por: Ge, Tao, et al.
Publicado: (2024)
Improved Evidence Extraction and Metrics for Document Inconsistency Detection with LLMs
por: Tan, Nelvin, et al.
Publicado: (2026)
por: Tan, Nelvin, et al.
Publicado: (2026)
Misleading through Inconsistency: A Benchmark for Political Inconsistencies Detection
por: Sagimbayeva, Nursulu, et al.
Publicado: (2025)
por: Sagimbayeva, Nursulu, et al.
Publicado: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
Ejemplares similares
-
Entropy Guided Extrapolative Decoding to Improve Factuality in Large Language Models
por: Das, Souvik, et al.
Publicado: (2024) -
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
por: Li, Xiangci, et al.
Publicado: (2024) -
Collaborative decoding of critical tokens for boosting factuality of large language models
por: Jin, Lifeng, et al.
Publicado: (2024) -
Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing
por: Tian, Ye, et al.
Publicado: (2024) -
Self-Consistency Boosts Calibration for Math Reasoning
por: Wang, Ante, et al.
Publicado: (2024)