CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Ruiyao, Parmar, Mihir, Yang, Tiankai, Hu, Zhengyu, Zhao, Yue, Ding, Kaize |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CoAct: A Global-Local Hierarchy for Autonomous Agent Collaboration
by: Hou, Xinming, et al.
Published: (2024)
by: Hou, Xinming, et al.
Published: (2024)
Cat-DPO: Category-Adaptive Safety Alignment
by: Yang, Tiankai, et al.
Published: (2026)
by: Yang, Tiankai, et al.
Published: (2026)
CoAct-1: Computer-using Multi-Agent System with Coding Actions
by: Song, Linxin, et al.
Published: (2025)
by: Song, Linxin, et al.
Published: (2025)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
by: Yang, Tiankai, et al.
Published: (2026)
by: Yang, Tiankai, et al.
Published: (2026)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
by: Yang, Tiankai, et al.
Published: (2024)
by: Yang, Tiankai, et al.
Published: (2024)
HopRank: Self-Supervised LLM Preference-Tuning on Graphs for Few-Shot Node Classification
by: Wang, Ziqing, et al.
Published: (2026)
by: Wang, Ziqing, et al.
Published: (2026)
Explaining Length Bias in LLM-Based Preference Evaluations
by: Hu, Zhengyu, et al.
Published: (2024)
by: Hu, Zhengyu, et al.
Published: (2024)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
by: Hu, Zhengyu, et al.
Published: (2024)
by: Hu, Zhengyu, et al.
Published: (2024)
Large Language Models for Anomaly and Out-of-Distribution Detection: A Survey
by: Xu, Ruiyao, et al.
Published: (2024)
by: Xu, Ruiyao, et al.
Published: (2024)
CoCoA: Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy
by: Jiang, Yi, et al.
Published: (2025)
by: Jiang, Yi, et al.
Published: (2025)
Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight
by: Yang, Haolin, et al.
Published: (2025)
by: Yang, Haolin, et al.
Published: (2025)
StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization
by: Tang, Yiming, et al.
Published: (2025)
by: Tang, Yiming, et al.
Published: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
by: Liu, Chris Yuhao, et al.
Published: (2025)
by: Liu, Chris Yuhao, et al.
Published: (2025)
HumanLLM: Towards Personalized Understanding and Simulation of Human Nature
by: Lei, Yuxuan, et al.
Published: (2026)
by: Lei, Yuxuan, et al.
Published: (2026)
CoAuthorAI: A Human in the Loop System For Scientific Book Writing
by: Tian, Yangjie, et al.
Published: (2026)
by: Tian, Yangjie, et al.
Published: (2026)
Dissecting Human and LLM Preferences
by: Li, Junlong, et al.
Published: (2024)
by: Li, Junlong, et al.
Published: (2024)
OmniScientist: Toward a Co-evolving Ecosystem of Human and AI Scientists
by: Shao, Chenyang, et al.
Published: (2025)
by: Shao, Chenyang, et al.
Published: (2025)
CoCR-RAG: Enhancing Retrieval-Augmented Generation in Web Q&A via Concept-oriented Context Reconstruction
by: Shi, Kaize, et al.
Published: (2026)
by: Shi, Kaize, et al.
Published: (2026)
Population-Aligned Persona Generation for LLM-based Social Simulation
by: Hu, Zhengyu, et al.
Published: (2025)
by: Hu, Zhengyu, et al.
Published: (2025)
CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers
by: Deng, Hexuan, et al.
Published: (2026)
by: Deng, Hexuan, et al.
Published: (2026)
Exploring the Human-LLM Synergy in Advancing Theory-driven Qualitative Analysis
by: Meng, Han, et al.
Published: (2024)
by: Meng, Han, et al.
Published: (2024)
The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval
by: Tong, Zekai, et al.
Published: (2026)
by: Tong, Zekai, et al.
Published: (2026)
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
by: Wang, Yinjie, et al.
Published: (2025)
by: Wang, Yinjie, et al.
Published: (2025)
DS$^2$-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning
by: Xu, Ruiyao, et al.
Published: (2026)
by: Xu, Ruiyao, et al.
Published: (2026)
Nash CoT: Multi-Path Inference with Preference Equilibrium
by: Zhang, Ziqi, et al.
Published: (2024)
by: Zhang, Ziqi, et al.
Published: (2024)
Towards Autoformalization of LLM-generated Outputs for Requirement Verification
by: Gupte, Mihir, et al.
Published: (2025)
by: Gupte, Mihir, et al.
Published: (2025)
MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
by: Cui, Jin, et al.
Published: (2026)
by: Cui, Jin, et al.
Published: (2026)
NLP-ADBench: NLP Anomaly Detection Benchmark
by: Li, Yuangang, et al.
Published: (2024)
by: Li, Yuangang, et al.
Published: (2024)
Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback
by: Miranda, Lester James V., et al.
Published: (2024)
by: Miranda, Lester James V., et al.
Published: (2024)
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
by: Yang, Shidong, et al.
Published: (2026)
by: Yang, Shidong, et al.
Published: (2026)
Synthetic Clinical Notes for Rare ICD Codes: A Data-Centric Framework for Long-Tail Medical Coding
by: Vo, Truong, et al.
Published: (2025)
by: Vo, Truong, et al.
Published: (2025)
Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents
by: Ding, Wenxuan, et al.
Published: (2026)
by: Ding, Wenxuan, et al.
Published: (2026)
Human-AI Co-design for Clinical Prediction Models
by: Feng, Jean, et al.
Published: (2026)
by: Feng, Jean, et al.
Published: (2026)
LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation
by: Li, Jinze, et al.
Published: (2026)
by: Li, Jinze, et al.
Published: (2026)
Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent
by: Huang, Zhongzhen, et al.
Published: (2026)
by: Huang, Zhongzhen, et al.
Published: (2026)
A Survey on Human Preference Learning for Large Language Models
by: Jiang, Ruili, et al.
Published: (2024)
by: Jiang, Ruili, et al.
Published: (2024)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
by: Chen, Jierun, et al.
Published: (2025)
by: Chen, Jierun, et al.
Published: (2025)
How Likely Do LLMs with CoT Mimic Human Reasoning?
by: Bao, Guangsheng, et al.
Published: (2024)
by: Bao, Guangsheng, et al.
Published: (2024)
The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection
by: Hu, Zhengyu, et al.
Published: (2026)
by: Hu, Zhengyu, et al.
Published: (2026)
Similar Items
-
CoAct: A Global-Local Hierarchy for Autonomous Agent Collaboration
by: Hou, Xinming, et al.
Published: (2024) -
Cat-DPO: Category-Adaptive Safety Alignment
by: Yang, Tiankai, et al.
Published: (2026) -
CoAct-1: Computer-using Multi-Agent System with Coding Actions
by: Song, Linxin, et al.
Published: (2025) -
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
by: Xu, Ruiyao, et al.
Published: (2026) -
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
by: Yang, Tiankai, et al.
Published: (2026)