Generalized Parallel Scaling with Interdependent Generations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dong, Harry, Brandfonbrener, David, Helenowski, Eryk, He, Yun, Kumar, Mrinal, Fang, Han, Chi, Yuejie, Sankararaman, Karthik Abinav |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement Learning from User Feedback
par: Han, Eric, et autres
Publié: (2025)
par: Han, Eric, et autres
Publié: (2025)
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
The Perfect Blend: Redefining RLHF with Mixture of Judges
par: Xu, Tengyu, et autres
Publié: (2024)
par: Xu, Tengyu, et autres
Publié: (2024)
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
par: Yu, Zishun, et autres
Publié: (2025)
par: Yu, Zishun, et autres
Publié: (2025)
Controllable Discovery of Intents: Incremental Deep Clustering Using Semi-Supervised Contrastive Learning
par: Rawat, Mrinal, et autres
Publié: (2024)
par: Rawat, Mrinal, et autres
Publié: (2024)
Scalable LLM Reasoning Acceleration with Low-rank Distillation
par: Dong, Harry, et autres
Publié: (2025)
par: Dong, Harry, et autres
Publié: (2025)
On the Equivalence of Graph Convolution and Mixup
par: Han, Xiaotian, et autres
Publié: (2023)
par: Han, Xiaotian, et autres
Publié: (2023)
Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
Do Understanding and Generation Fight? A Diagnostic Study of DPO for Unified Multimodal Models
par: Rao, Abinav, et autres
Publié: (2026)
par: Rao, Abinav, et autres
Publié: (2026)
The Role of Sparsity for Length Generalization in Transformers
par: Golowich, Noah, et autres
Publié: (2025)
par: Golowich, Noah, et autres
Publié: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
par: Brandfonbrener, David, et autres
Publié: (2024)
par: Brandfonbrener, David, et autres
Publié: (2024)
Transformers Provably Learn Chain-of-Thought Reasoning with Length Generalization
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
Contextual Bandits with Packing and Covering Constraints: A Modular Lagrangian Approach via Regression
par: Slivkins, Aleksandrs, et autres
Publié: (2022)
par: Slivkins, Aleksandrs, et autres
Publié: (2022)
Deconstructing What Makes a Good Optimizer for Language Models
par: Zhao, Rosie, et autres
Publié: (2024)
par: Zhao, Rosie, et autres
Publié: (2024)
The Art of Scaling Reinforcement Learning Compute for LLMs
par: Khatri, Devvrit, et autres
Publié: (2025)
par: Khatri, Devvrit, et autres
Publié: (2025)
Towards Low-bit Communication for Tensor Parallel LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
USP: A Unified Sequence Parallelism Approach for Long Context Generative AI
par: Fang, Jiarui, et autres
Publié: (2024)
par: Fang, Jiarui, et autres
Publié: (2024)
Graph Hopfield Networks: Energy-Based Node Classification with Associative Memory
par: Rao, Abinav, et autres
Publié: (2026)
par: Rao, Abinav, et autres
Publié: (2026)
Scaling Test-Time Compute for Agentic Coding
par: Kim, Joongwon, et autres
Publié: (2026)
par: Kim, Joongwon, et autres
Publié: (2026)
Repeat After Me: Transformers are Better than State Space Models at Copying
par: Jelassi, Samy, et autres
Publié: (2024)
par: Jelassi, Samy, et autres
Publié: (2024)
LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training
par: Wu, Bo, et autres
Publié: (2025)
par: Wu, Bo, et autres
Publié: (2025)
Federated Natural Policy Gradient and Actor Critic Methods for Multi-task Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2023)
par: Yang, Tong, et autres
Publié: (2023)
Subgraph Generation for Generalizing on Out-of-Distribution Links
par: Revolinsky, Jay, et autres
Publié: (2025)
par: Revolinsky, Jay, et autres
Publié: (2025)
Brain-Inspired Planning for Better Generalization in Reinforcement Learning
par: Zhao, Mingde "Harry"
Publié: (2025)
par: Zhao, Mingde "Harry"
Publié: (2025)
Preconditioning Benefits of Spectral Orthogonalization in Muon
par: Ma, Jianhao, et autres
Publié: (2026)
par: Ma, Jianhao, et autres
Publié: (2026)
Agentic Transformers Provably Learn to Search via Reinforcement Learning
par: Yang, Tong, et autres
Publié: (2026)
par: Yang, Tong, et autres
Publié: (2026)
Statistical and Algorithmic Foundations of Reinforcement Learning
par: Chi, Yuejie, et autres
Publié: (2025)
par: Chi, Yuejie, et autres
Publié: (2025)
CoLoR-Filter: Conditional Loss Reduction Filtering for Targeted Language Model Pre-training
par: Brandfonbrener, David, et autres
Publié: (2024)
par: Brandfonbrener, David, et autres
Publié: (2024)
Learning Discrete Concepts in Latent Hierarchical Models
par: Kong, Lingjing, et autres
Publié: (2024)
par: Kong, Lingjing, et autres
Publié: (2024)
Are Expressive Encoders Necessary for Discrete Graph Generation?
par: Revolinsky, Jay, et autres
Publié: (2026)
par: Revolinsky, Jay, et autres
Publié: (2026)
SOAP: Improving and Stabilizing Shampoo using Adam
par: Vyas, Nikhil, et autres
Publié: (2024)
par: Vyas, Nikhil, et autres
Publié: (2024)
ASAP: Exploiting the Satisficing Generalization Edge in Neural Combinatorial Optimization
par: Fang, Han, et autres
Publié: (2025)
par: Fang, Han, et autres
Publié: (2025)
OptEx: Expediting First-Order Optimization with Approximately Parallelized Iterations
par: Shu, Yao, et autres
Publié: (2024)
par: Shu, Yao, et autres
Publié: (2024)
Skills Made to Order: Efficient Acquisition of Robot Cooking Skills Guided by Multiple Forms of Internet Data
par: Verghese, Mrinal, et autres
Publié: (2024)
par: Verghese, Mrinal, et autres
Publié: (2024)
Multi-head Transformers Provably Learn Symbolic Multi-step Reasoning via Gradient Descent
par: Yang, Tong, et autres
Publié: (2025)
par: Yang, Tong, et autres
Publié: (2025)
Diffusion Controller: Framework, Algorithms and Parameterization
par: Yang, Tong, et autres
Publié: (2026)
par: Yang, Tong, et autres
Publié: (2026)
Chain-of-Influence: Tracing Interdependencies Across Time and Features in Clinical Predictive Modelings
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
Scaling Up Data Parallelism in Decentralized Deep Learning
par: Xie, Bing, et autres
Publié: (2025)
par: Xie, Bing, et autres
Publié: (2025)
Uncertainty-Aware Hybrid Machine Learning in Virtual Sensors for Vehicle Sideslip Angle Estimation
par: Kalyanasundaram, Abinav, et autres
Publié: (2025)
par: Kalyanasundaram, Abinav, et autres
Publié: (2025)
PCGRL+: Scaling, Control and Generalization in Reinforcement Learning Level Generators
par: Earle, Sam, et autres
Publié: (2024)
par: Earle, Sam, et autres
Publié: (2024)
Documents similaires
-
Reinforcement Learning from User Feedback
par: Han, Eric, et autres
Publié: (2025) -
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024) -
The Perfect Blend: Redefining RLHF with Mixture of Judges
par: Xu, Tengyu, et autres
Publié: (2024) -
Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization
par: Yu, Zishun, et autres
Publié: (2025) -
Controllable Discovery of Intents: Incremental Deep Clustering Using Semi-Supervised Contrastive Learning
par: Rawat, Mrinal, et autres
Publié: (2024)