AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Haizhong, Di, Yizhuo, Wang, Jiahui, Jin, Shuowei, Liu, Xueshen, Wu, Yongji, Mao, Z. Morley, Stoica, Ion, Zhao, Jiawei, Chen, Beidi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs
di: Wu, Yongji, et al.
Pubblicazione: (2025)
di: Wu, Yongji, et al.
Pubblicazione: (2025)
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
di: Wu, Yongji, et al.
Pubblicazione: (2025)
di: Wu, Yongji, et al.
Pubblicazione: (2025)
Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start
di: Liu, Xueshen, et al.
Pubblicazione: (2026)
di: Liu, Xueshen, et al.
Pubblicazione: (2026)
Compute Or Load KV Cache? Why Not Both?
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
Plato: Plan to Efficiently Decode for Large Language Model Inference
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
Learn To be Efficient: Build Structured Sparsity in Large Language Models
di: Zheng, Haizhong, et al.
Pubblicazione: (2024)
di: Zheng, Haizhong, et al.
Pubblicazione: (2024)
Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
Eagle: Efficient Training-Free Router for Multi-LLM Inference
di: Zhao, Zesen, et al.
Pubblicazione: (2024)
di: Zhao, Zesen, et al.
Pubblicazione: (2024)
Lazarus: Resilient and Elastic Training of Mixture-of-Experts Models
di: Wu, Yongji, et al.
Pubblicazione: (2024)
di: Wu, Yongji, et al.
Pubblicazione: (2024)
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
di: Hu, Pingbang, et al.
Pubblicazione: (2026)
di: Hu, Pingbang, et al.
Pubblicazione: (2026)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning
di: Chen, Zhuoming, et al.
Pubblicazione: (2026)
di: Chen, Zhuoming, et al.
Pubblicazione: (2026)
Some Present-Day Problems of Romanian Library Science
di: Stoica, Ion
Pubblicazione: (1973)
di: Stoica, Ion
Pubblicazione: (1973)
The Central University Library, Bucharest. Over Seventy-five Years in the History of a Collection
di: Stoica, Ion
Pubblicazione: (1972)
di: Stoica, Ion
Pubblicazione: (1972)
AutoSpec: Automated Generation of Neural Network Specifications
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
di: Jin, Shuowei, et al.
Pubblicazione: (2024)
QUIC is not Quick Enough over Fast Internet
di: Zhang, Xumiao, et al.
Pubblicazione: (2023)
di: Zhang, Xumiao, et al.
Pubblicazione: (2023)
MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search
di: Cho, Minkyoung, et al.
Pubblicazione: (2026)
di: Cho, Minkyoung, et al.
Pubblicazione: (2026)
Revisiting Cache Freshness for Emerging Real-Time Applications
di: Mao, Ziming, et al.
Pubblicazione: (2024)
di: Mao, Ziming, et al.
Pubblicazione: (2024)
Kinetics: Rethinking Test-Time Scaling Laws
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2025)
di: Sadhukhan, Ranajoy, et al.
Pubblicazione: (2025)
DORA: Dataflow Oriented Robotic Architecture
di: Zhang, Xiaodong, et al.
Pubblicazione: (2026)
di: Zhang, Xiaodong, et al.
Pubblicazione: (2026)
Astra Salvensis
Pubblicazione: (2019)
Pubblicazione: (2019)
K-Search: LLM Kernel Generation via Co-Evolving Intrinsic World Model
di: Cao, Shiyi, et al.
Pubblicazione: (2026)
di: Cao, Shiyi, et al.
Pubblicazione: (2026)
Lex Ad Astra
di: Cvetkovič, Iva Ramuš, et al.
Pubblicazione: (2025)
di: Cvetkovič, Iva Ramuš, et al.
Pubblicazione: (2025)
Pie: Pooling CPU Memory for LLM Inference
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning
di: Wang, Haixin, et al.
Pubblicazione: (2026)
di: Wang, Haixin, et al.
Pubblicazione: (2026)
AstraAI: LLMs, Retrieval, and AST-Guided Assistance for HPC Codebases
di: Natarajan, Mahesh, et al.
Pubblicazione: (2026)
di: Natarajan, Mahesh, et al.
Pubblicazione: (2026)
Flat Rotation Curves from Vacuum Pressure in a Self-Gravitating Nonlinear Scalar Field
di: An, Haizhong
Pubblicazione: (2026)
di: An, Haizhong
Pubblicazione: (2026)
Structural Conjectures for Particle Topology and Black Hole Morphology in a Discrete Field-Quantum Network
di: An, Haizhong
Pubblicazione: (2026)
di: An, Haizhong
Pubblicazione: (2026)
The An Theory: Gravity, Electromagnetism, Strong Confinement, and Quantum Measurement from a Single Nearest-Neighbor Attraction Rule in a Rigid Field-Quantum Background
di: An, Haizhong
Pubblicazione: (2026)
di: An, Haizhong
Pubblicazione: (2026)
The Neutrino as a Spinning Soliton in a Discrete Field-Quantum Network: Numerical Evidence in 3D, a Geometric Picture for Beta Decay, and Open Problems
di: An, Haizhong
Pubblicazione: (2026)
di: An, Haizhong
Pubblicazione: (2026)
A Discrete Field-Quantum Network with Nearest-Neighbor Attraction: Gravity, Strong Confinement, Quantum Measurement, and Evidence for Emergent Gauge Structure
di: An, Haizhong
Pubblicazione: (2026)
di: An, Haizhong
Pubblicazione: (2026)
Per Aspera ad Astra
Pubblicazione: (2025)
Pubblicazione: (2025)
Final Report PT Astra
di: Sipakkar, Jessica
Pubblicazione: (2026)
di: Sipakkar, Jessica
Pubblicazione: (2026)
AstraZeneca and the importance of innovation
Pubblicazione: (2024)
Pubblicazione: (2024)
MonarchRT: Efficient Attention for Real-Time Video Generation
di: Agarwal, Krish, et al.
Pubblicazione: (2026)
di: Agarwal, Krish, et al.
Pubblicazione: (2026)
The Influence of Gen‐AI Assisted Learning on Primary School Students' Math Anxiety: An Intervention Study
di: Xueshen Wang, et al.
Pubblicazione: (2025)
di: Xueshen Wang, et al.
Pubblicazione: (2025)
Dataflow-Oriented Classification and Performance Analysis of GPU-Accelerated Homomorphic Encryption
di: Nozaki, Ai, et al.
Pubblicazione: (2026)
di: Nozaki, Ai, et al.
Pubblicazione: (2026)
Astra: General Interactive World Model with Autoregressive Denoising
di: Zhu, Yixuan, et al.
Pubblicazione: (2025)
di: Zhu, Yixuan, et al.
Pubblicazione: (2025)
Idleness is Relative: Exploiting Tool-Call Idle Windows for Offloading in Agentic Systems with MORI
di: Xia, Tian, et al.
Pubblicazione: (2026)
di: Xia, Tian, et al.
Pubblicazione: (2026)
From Stealthy Data Fabrication to Unsafe Driving: Realistic Scenario Attacks on Collaborative Perception
di: Zhang, Qingzhao, et al.
Pubblicazione: (2026)
di: Zhang, Qingzhao, et al.
Pubblicazione: (2026)
Documenti analoghi
-
RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs
di: Wu, Yongji, et al.
Pubblicazione: (2025) -
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
di: Wu, Yongji, et al.
Pubblicazione: (2025) -
Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start
di: Liu, Xueshen, et al.
Pubblicazione: (2026) -
Compute Or Load KV Cache? Why Not Both?
di: Jin, Shuowei, et al.
Pubblicazione: (2024) -
Plato: Plan to Efficiently Decode for Large Language Model Inference
di: Jin, Shuowei, et al.
Pubblicazione: (2024)