Enregistré dans:
| Auteurs principaux: | Zhou, Yuhang, Zhang, Mingrui, Li, Ke, Wang, Mingyi, Liu, Qiao, Wang, Qifei, Liu, Jiayi, Liu, Fei, Li, Serena, Li, Weiwei, Gao, Mingze, Kumar, Abhishek, Fan, Xiangjun, Zhao, Zhuokai, Zhang, Lizhu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2510.20176 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLM-Driven Reasoning for Constraint-Aware Feature Selection in Industrial Systems
par: Zhou, Yuhang, et autres
Publié: (2026)
par: Zhou, Yuhang, et autres
Publié: (2026)
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
par: Zhou, Yuhang, et autres
Publié: (2026)
par: Zhou, Yuhang, et autres
Publié: (2026)
Synthetic Sandbox for Training Machine Learning Engineering Agents
par: Zhou, Yuhang, et autres
Publié: (2026)
par: Zhou, Yuhang, et autres
Publié: (2026)
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
par: Han, Kevin, et autres
Publié: (2026)
par: Han, Kevin, et autres
Publié: (2026)
S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
par: Zeng, Hanqing, et autres
Publié: (2025)
par: Zeng, Hanqing, et autres
Publié: (2025)
GEM: Empowering LLM for both Embedding Generation and Language Understanding
par: Zhang, Caojin, et autres
Publié: (2025)
par: Zhang, Caojin, et autres
Publié: (2025)
RecoWorld: Building Simulated Environments for Agentic Recommender Systems
par: Liu, Fei, et autres
Publié: (2025)
par: Liu, Fei, et autres
Publié: (2025)
CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning
par: Yu, Hao, et autres
Publié: (2025)
par: Yu, Hao, et autres
Publié: (2025)
Thought Communication in Multiagent Collaboration
par: Zheng, Yujia, et autres
Publié: (2025)
par: Zheng, Yujia, et autres
Publié: (2025)
Exploring System 1 and 2 communication for latent reasoning in LLMs
par: Coda-Forno, Julian, et autres
Publié: (2025)
par: Coda-Forno, Julian, et autres
Publié: (2025)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
par: Wang, Chaoqi, et autres
Publié: (2025)
par: Wang, Chaoqi, et autres
Publié: (2025)
TARo: Token-level Adaptive Routing for LLM Test-time Alignment
par: Rai, Arushi, et autres
Publié: (2026)
par: Rai, Arushi, et autres
Publié: (2026)
Agentic Recommender System with Hierarchical Belief-State Memory
par: Shen, Xiang, et autres
Publié: (2026)
par: Shen, Xiang, et autres
Publié: (2026)
Let it Calm: Exploratory Annealed Decoding for Verifiable Reinforcement Learning
par: Yang, Chenghao, et autres
Publié: (2025)
par: Yang, Chenghao, et autres
Publié: (2025)
Token-Level LLM Collaboration via FusionRoute
par: Xiong, Nuoya, et autres
Publié: (2026)
par: Xiong, Nuoya, et autres
Publié: (2026)
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
par: Yang, Yanlai, et autres
Publié: (2025)
par: Yang, Yanlai, et autres
Publié: (2025)
Facet-Aware Multi-Head Mixture-of-Experts Model for Sequential Recommendation
par: Liu, Mingrui, et autres
Publié: (2024)
par: Liu, Mingrui, et autres
Publié: (2024)
GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification
par: Fostiropoulos, Iordanis, et autres
Publié: (2026)
par: Fostiropoulos, Iordanis, et autres
Publié: (2026)
Grid Evolution for Doubly Fractional Channel Estimation in OTFS Systems
par: Li, Xiangjun, et autres
Publié: (2024)
par: Li, Xiangjun, et autres
Publié: (2024)
Facet-Aware Multi-Head Mixture-of-Experts Model with Text-Enhanced Pre-training for Sequential Recommendation
par: Liu, Mingrui, et autres
Publié: (2026)
par: Liu, Mingrui, et autres
Publié: (2026)
A Joint Prediction Method of Multi-Agent to Reduce Collision Rate
par: Wang, Mingyi, et autres
Publié: (2024)
par: Wang, Mingyi, et autres
Publié: (2024)
DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts
par: Feng, Jiarui, et autres
Publié: (2026)
par: Feng, Jiarui, et autres
Publié: (2026)
DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
par: Zhou, Yuhang, et autres
Publié: (2025)
par: Zhou, Yuhang, et autres
Publié: (2025)
InfoPO: Information-Driven Policy Optimization for User-Centric Agents
par: Kong, Fanqi, et autres
Publié: (2026)
par: Kong, Fanqi, et autres
Publié: (2026)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
par: Wang, Zihan, et autres
Publié: (2025)
par: Wang, Zihan, et autres
Publié: (2025)
Understanding Inverse Reinforcement Learning under Overparameterization: Non-Asymptotic Analysis and Global Optimality
par: Zhang, Ruijia, et autres
Publié: (2025)
par: Zhang, Ruijia, et autres
Publié: (2025)
On the Expressive Power of Mixture-of-Experts for Structured Complex Tasks
par: Wang, Mingze, et autres
Publié: (2025)
par: Wang, Mingze, et autres
Publié: (2025)
RieMind: Geometry-Grounded Spatial Agent for Scene Understanding
par: Ropero, Fernando, et autres
Publié: (2026)
par: Ropero, Fernando, et autres
Publié: (2026)
UrbanMind: Urban Dynamics Prediction with Multifaceted Spatial-Temporal Large Language Models
par: Liu, Yuhang, et autres
Publié: (2025)
par: Liu, Yuhang, et autres
Publié: (2025)
Destroy and Repair Using Hyper Graphs for Routing
par: Li, Ke, et autres
Publié: (2025)
par: Li, Ke, et autres
Publié: (2025)
CoMind: Towards Community-Driven Agents for Machine Learning Engineering
par: Li, Sijie, et autres
Publié: (2025)
par: Li, Sijie, et autres
Publié: (2025)
Chain-of-Query: Unleashing the Power of LLMs in SQL-Aided Table Understanding via Multi-Agent Collaboration
par: Sui, Songyuan, et autres
Publié: (2025)
par: Sui, Songyuan, et autres
Publié: (2025)
Matched Filtering-Based Channel Estimation for AFDM Systems in Doubly Selective Channels
par: Li, Xiangjun, et autres
Publié: (2025)
par: Li, Xiangjun, et autres
Publié: (2025)
Agentic Reinforcement Learning with Implicit Step Rewards
par: Liu, Xiaoqian, et autres
Publié: (2025)
par: Liu, Xiaoqian, et autres
Publié: (2025)
An Online Review‐Driven Multiattribute Decision‐Making Model Based on Rough‐Cloud‐Integrated Three‐Way Decisions
par: Fan Jia, et autres
Publié: (2026)
par: Fan Jia, et autres
Publié: (2026)
Understanding Nonlinear Collaboration between Human and AI Agents: A Co-design Framework for Creative Design
par: Zhou, Jiayi, et autres
Publié: (2024)
par: Zhou, Jiayi, et autres
Publié: (2024)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
par: Liu, Yuhong, et autres
Publié: (2025)
par: Liu, Yuhong, et autres
Publié: (2025)
Functionality Locality, Mixture & Control = Logic = Memory
par: Peng, Xiangjun
Publié: (2024)
par: Peng, Xiangjun
Publié: (2024)
Preliminary analysis on the interdecadal variation characteristics of typhoon over the Northwestern Pacific in the past sixty years.
par: Yu, Fan, et autres
Publié: (2012)
par: Yu, Fan, et autres
Publié: (2012)
Preliminary analysis on the interdecadal variation characteristics of typhoon over the Northwestern Pacific in the past sixty years.
par: Yu, Fan, et autres
Publié: (2012)
par: Yu, Fan, et autres
Publié: (2012)
Documents similaires
-
LLM-Driven Reasoning for Constraint-Aware Feature Selection in Industrial Systems
par: Zhou, Yuhang, et autres
Publié: (2026) -
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
par: Zhou, Yuhang, et autres
Publié: (2026) -
Synthetic Sandbox for Training Machine Learning Engineering Agents
par: Zhou, Yuhang, et autres
Publié: (2026) -
EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization
par: Han, Kevin, et autres
Publié: (2026) -
S'MoRE: Structural Mixture of Residual Experts for Parameter-Efficient LLM Fine-tuning
par: Zeng, Hanqing, et autres
Publié: (2025)