AERO: Autonomous Evolutionary Reasoning Optimization via Endogenous Dual-Loop Feedback
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Zhitao, Ma, Jie, Li, Xuhong, Li, Pengyu, Qu, Ning, Wu, Yaqiang, Liu, Hui, Liu, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
$\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality
di: Li, Pengyu, et al.
Pubblicazione: (2026)
di: Li, Pengyu, et al.
Pubblicazione: (2026)
Guiding LLM-based Loop Invariant Synthesis via Feedback on Local Reasoning Errors
di: Li, Tianchi, et al.
Pubblicazione: (2026)
di: Li, Tianchi, et al.
Pubblicazione: (2026)
Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs
di: Ma, Jie, et al.
Pubblicazione: (2025)
di: Ma, Jie, et al.
Pubblicazione: (2025)
Scaling Latent Reasoning via Looped Language Models
di: Zhu, Rui-Jie, et al.
Pubblicazione: (2025)
di: Zhu, Rui-Jie, et al.
Pubblicazione: (2025)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
di: Zhang, Yong, et al.
Pubblicazione: (2025)
di: Zhang, Yong, et al.
Pubblicazione: (2025)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
di: Li, Yafu, et al.
Pubblicazione: (2025)
di: Li, Yafu, et al.
Pubblicazione: (2025)
ChartSketcher: Reasoning with Multimodal Feedback and Reflection for Chart Understanding
di: Huang, Muye, et al.
Pubblicazione: (2025)
di: Huang, Muye, et al.
Pubblicazione: (2025)
FortisAVQA and MAVEN: a Benchmark Dataset and Debiasing Framework for Robust Multimodal Reasoning
di: Ma, Jie, et al.
Pubblicazione: (2025)
di: Ma, Jie, et al.
Pubblicazione: (2025)
Enhancing Large Language Model Reasoning with Reward Models: An Analytical Survey
di: Liu, Qiyuan, et al.
Pubblicazione: (2025)
di: Liu, Qiyuan, et al.
Pubblicazione: (2025)
RA-ISF: Learning to Answer and Understand from Retrieval Augmentation via Iterative Self-Feedback
di: Liu, Yanming, et al.
Pubblicazione: (2024)
di: Liu, Yanming, et al.
Pubblicazione: (2024)
OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
di: Zhang, Xinyu, et al.
Pubblicazione: (2026)
In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Autonomous Algorithm Discovery for Ptychography via Evolutionary LLM Reasoning
di: Yin, Xiangyu, et al.
Pubblicazione: (2026)
di: Yin, Xiangyu, et al.
Pubblicazione: (2026)
Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA
di: Wang, Zihua, et al.
Pubblicazione: (2026)
di: Wang, Zihua, et al.
Pubblicazione: (2026)
Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning
di: Deng, Jie, et al.
Pubblicazione: (2026)
di: Deng, Jie, et al.
Pubblicazione: (2026)
From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning
di: Li, Haoyu, et al.
Pubblicazione: (2025)
di: Li, Haoyu, et al.
Pubblicazione: (2025)
Evolutionary Pre-Prompt Optimization for Mathematical Reasoning
di: Videau, Mathurin, et al.
Pubblicazione: (2024)
di: Videau, Mathurin, et al.
Pubblicazione: (2024)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
di: Ning, Yansong, et al.
Pubblicazione: (2025)
di: Ning, Yansong, et al.
Pubblicazione: (2025)
SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback
di: Yu, Yaoning, et al.
Pubblicazione: (2025)
di: Yu, Yaoning, et al.
Pubblicazione: (2025)
THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
di: Chang, Qikai, et al.
Pubblicazione: (2025)
di: Chang, Qikai, et al.
Pubblicazione: (2025)
EPO: Explicit Policy Optimization for Strategic Reasoning in LLMs via Reinforcement Learning
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
di: Liu, Xiaoqian, et al.
Pubblicazione: (2025)
Preference Optimization for Reasoning with Pseudo Feedback
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)
Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
di: Zhu, Xunyu, et al.
Pubblicazione: (2024)
Debate on Graph: a Flexible and Reliable Reasoning Framework for Large Language Models
di: Ma, Jie, et al.
Pubblicazione: (2024)
di: Ma, Jie, et al.
Pubblicazione: (2024)
Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization
di: Lu, Junjie, et al.
Pubblicazione: (2025)
di: Lu, Junjie, et al.
Pubblicazione: (2025)
VeriReason: Reinforcement Learning with Testbench Feedback for Reasoning-Enhanced Verilog Generation
di: Wang, Yiting, et al.
Pubblicazione: (2025)
di: Wang, Yiting, et al.
Pubblicazione: (2025)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
di: Peng, Qiwei, et al.
Pubblicazione: (2024)
di: Peng, Qiwei, et al.
Pubblicazione: (2024)
Joint Optimization of Reasoning and Dual-Memory for Self-Learning Diagnostic Agent
di: Li, Bingxuan, et al.
Pubblicazione: (2026)
di: Li, Bingxuan, et al.
Pubblicazione: (2026)
GRASP: Replace Redundant Layers with Adaptive Singular Parameters for Efficient Model Compression
di: Liu, Kainan, et al.
Pubblicazione: (2024)
di: Liu, Kainan, et al.
Pubblicazione: (2024)
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
di: Wei, Yifan, et al.
Pubblicazione: (2025)
di: Wei, Yifan, et al.
Pubblicazione: (2025)
Short Chains, Deep Thoughts: Balancing Reasoning Efficiency and Intra-Segment Capability via Split-Merge Optimization
di: Gui, Runquan, et al.
Pubblicazione: (2026)
di: Gui, Runquan, et al.
Pubblicazione: (2026)
Decoupled Reasoning with Implicit Fact Tokens (DRIFT): A Dual-Model Framework for Efficient Long-Context Inference
di: Xie, Wenxuan, et al.
Pubblicazione: (2026)
di: Xie, Wenxuan, et al.
Pubblicazione: (2026)
A Multi-AI Agent System for Autonomous Optimization of Agentic AI Solutions via Iterative Refinement and LLM-Driven Feedback Loops
di: Yuksel, Kamer Ali, et al.
Pubblicazione: (2024)
di: Yuksel, Kamer Ali, et al.
Pubblicazione: (2024)
Dual-Phase Accelerated Prompt Optimization
di: Yang, Muchen, et al.
Pubblicazione: (2024)
di: Yang, Muchen, et al.
Pubblicazione: (2024)
Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning
di: Zhao, Chunxu, et al.
Pubblicazione: (2026)
di: Zhao, Chunxu, et al.
Pubblicazione: (2026)
SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
di: Huang, Muye, et al.
Pubblicazione: (2026)
di: Huang, Muye, et al.
Pubblicazione: (2026)
Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
di: Li, Aiden Yiliu, et al.
Pubblicazione: (2025)
BPO: Revisiting Preference Modeling in Direct Preference Optimization
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Efficient Reasoning via Chain of Unconscious Thought
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
di: Gong, Ruihan, et al.
Pubblicazione: (2025)
Robust Preference Optimization via Dynamic Target Margins
di: Sun, Jie, et al.
Pubblicazione: (2025)
di: Sun, Jie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
$\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality
di: Li, Pengyu, et al.
Pubblicazione: (2026) -
Guiding LLM-based Loop Invariant Synthesis via Feedback on Local Reasoning Errors
di: Li, Tianchi, et al.
Pubblicazione: (2026) -
Deliberation on Priors: Trustworthy Reasoning of Large Language Models on Knowledge Graphs
di: Ma, Jie, et al.
Pubblicazione: (2025) -
Scaling Latent Reasoning via Looped Language Models
di: Zhu, Rui-Jie, et al.
Pubblicazione: (2025) -
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
di: Zhang, Yong, et al.
Pubblicazione: (2025)