Enregistré dans:
| Auteurs principaux: | Mower, Christopher E., Wan, Yuhui, Yu, Hongzhan, Grosnit, Antoine, Gonzalez-Billandon, Jonas, Zimmer, Matthieu, Wang, Jinlong, Zhang, Xinyu, Zhao, Yao, Zhai, Anbang, Liu, Puze, Palenicek, Daniel, Tateo, Davide, Cadena, Cesar, Hutter, Marco, Peters, Jan, Tian, Guangjian, Zhuang, Yuzheng, Shao, Kun, Quan, Xingyue, Hao, Jianye, Wang, Jun, Bou-Ammar, Haitham |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.19741 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safe Reinforcement Learning on the Constraint Manifold: Theory and Applications
par: Liu, Puze, et autres
Publié: (2024)
par: Liu, Puze, et autres
Publié: (2024)
Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information
par: Tutnov, Rasul, et autres
Publié: (2025)
par: Tutnov, Rasul, et autres
Publié: (2025)
Al-Khwarizmi: Discovering Physical Laws with Foundation Models
par: Mower, Christopher E., et autres
Publié: (2025)
par: Mower, Christopher E., et autres
Publié: (2025)
Contextual Causal Bayesian Optimisation
par: Arsenyan, Vahan, et autres
Publié: (2023)
par: Arsenyan, Vahan, et autres
Publié: (2023)
Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates
par: Diwan, Anish, et autres
Publié: (2026)
par: Diwan, Anish, et autres
Publié: (2026)
Data-driven Interpretable Hybrid Robot Dynamics
par: Mower, Christopher E., et autres
Publié: (2025)
par: Mower, Christopher E., et autres
Publié: (2025)
Why Can Large Language Models Generate Correct Chain-of-Thoughts?
par: Tutunov, Rasul, et autres
Publié: (2023)
par: Tutunov, Rasul, et autres
Publié: (2023)
ShortCircuit: AlphaZero-Driven Circuit Design
par: Tsaras, Dimitrios, et autres
Publié: (2024)
par: Tsaras, Dimitrios, et autres
Publié: (2024)
Model-Based and Sample-Efficient AI-Assisted Math Discovery in Sphere Packing
par: Tutunov, Rasul, et autres
Publié: (2025)
par: Tutunov, Rasul, et autres
Publié: (2025)
A call for embodied AI
par: Paolo, Giuseppe, et autres
Publié: (2024)
par: Paolo, Giuseppe, et autres
Publié: (2024)
A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World
par: Qu, Kaixian, et autres
Publié: (2025)
par: Qu, Kaixian, et autres
Publié: (2025)
Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers
par: Ji, Xiaotong, et autres
Publié: (2026)
par: Ji, Xiaotong, et autres
Publié: (2026)
Scalable Power Sampling: Unlocking Efficient, Training-Free Reasoning for LLMs via Distribution Sharpening
par: Ji, Xiaotong, et autres
Publié: (2026)
par: Ji, Xiaotong, et autres
Publié: (2026)
Rethinking Large Language Model Distillation: A Constrained Markov Decision Process Perspective
par: Zimmer, Matthieu, et autres
Publié: (2025)
par: Zimmer, Matthieu, et autres
Publié: (2025)
Towards Safe Robot Foundation Models
par: Tölle, Maximilian, et autres
Publié: (2025)
par: Tölle, Maximilian, et autres
Publié: (2025)
The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling
par: Nguyen, Tu, et autres
Publié: (2026)
par: Nguyen, Tu, et autres
Publié: (2026)
Mixture of Attentions For Speculative Decoding
par: Zimmer, Matthieu, et autres
Publié: (2024)
par: Zimmer, Matthieu, et autres
Publié: (2024)
Risk-Controlled Lean-as-Judge for Natural-Language Mathematical Reasoning
par: Bourigault, Pauline, et autres
Publié: (2026)
par: Bourigault, Pauline, et autres
Publié: (2026)
The $\mathbf{Y}$-Combinator for LLMs: Solving Long-Context Rot with $λ$-Calculus
par: Roy, Amartya, et autres
Publié: (2026)
par: Roy, Amartya, et autres
Publié: (2026)
Towards Safe Robot Foundation Models Using Inductive Biases
par: Tölle, Maximilian, et autres
Publié: (2025)
par: Tölle, Maximilian, et autres
Publié: (2025)
Handling Long-Term Safety and Uncertainty in Safe Reinforcement Learning
par: Günster, Jonas, et autres
Publié: (2024)
par: Günster, Jonas, et autres
Publié: (2024)
Adaptive Control based Friction Estimation for Tracking Control of Robot Manipulators
par: Huang, Junning, et autres
Publié: (2024)
par: Huang, Junning, et autres
Publié: (2024)
Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving
par: Zimmer, Matthieu, et autres
Publié: (2025)
par: Zimmer, Matthieu, et autres
Publié: (2025)
LBR-Stack: ROS 2 and Python Integration of KUKA FRI for Med and IIWA Robots
par: Huber, Martin, et autres
Publié: (2023)
par: Huber, Martin, et autres
Publié: (2023)
On Almost Surely Safe Alignment of Large Language Models at Inference-Time
par: Ji, Xiaotong, et autres
Publié: (2025)
par: Ji, Xiaotong, et autres
Publié: (2025)
Materiobiomodulated ROS Therapy for De Novo Hair Growth
par: Long Bai, et autres
Publié: (2024)
par: Long Bai, et autres
Publié: (2024)
Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoning
par: Oomerjee, Adnan, et autres
Publié: (2025)
par: Oomerjee, Adnan, et autres
Publié: (2025)
Ark: An Open-source Python-based Framework for Robot Learning
par: Dierking, Magnus, et autres
Publié: (2025)
par: Dierking, Magnus, et autres
Publié: (2025)
Distilling Contact Planning for Fast Trajectory Optimization in Robot Air Hockey
par: Jankowski, Julius, et autres
Publié: (2024)
par: Jankowski, Julius, et autres
Publié: (2024)
Bridging the gap between Learning-to-plan, Motion Primitives and Safe Reinforcement Learning
par: Kicki, Piotr, et autres
Publié: (2024)
par: Kicki, Piotr, et autres
Publié: (2024)
SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks
par: Christopoulou, Fenia, et autres
Publié: (2024)
par: Christopoulou, Fenia, et autres
Publié: (2024)
Why the Brain Consolidates: Predictive Forgetting for Optimal Generalisation
par: Fountas, Zafeirios, et autres
Publié: (2026)
par: Fountas, Zafeirios, et autres
Publié: (2026)
Subjective Depth and Timescale Transformers: Learning Where and When to Compute
par: Wieser, Frederico, et autres
Publié: (2025)
par: Wieser, Frederico, et autres
Publié: (2025)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
par: Ramesh, Shyam Sundhar, et autres
Publié: (2026)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
par: Cai, Xinyan, et autres
Publié: (2025)
par: Cai, Xinyan, et autres
Publié: (2025)
daleihao/RDycore_ROS: Codes and data for the RDycore-ROS study
par: Dalei Hao
Publié: (2025)
par: Dalei Hao
Publié: (2025)
ROS2swarm - A ROS 2 Package for Swarm Robot Behaviors
par: Kaiser, Tanja Katharina, et autres
Publié: (2024)
par: Kaiser, Tanja Katharina, et autres
Publié: (2024)
Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods
par: Benfeghoul, Martin, et autres
Publié: (2025)
par: Benfeghoul, Martin, et autres
Publié: (2025)
Proxying ROS communications -- enabling containerized ROS deployments in distributed multi-host environments
par: Wendt, Arne, et autres
Publié: (2022)
par: Wendt, Arne, et autres
Publié: (2022)
Kolb-Based Experiential Learning for Generalist Agents with Human-Level Kaggle Data Science Performance
par: Grosnit, Antoine, et autres
Publié: (2024)
par: Grosnit, Antoine, et autres
Publié: (2024)
Documents similaires
-
Safe Reinforcement Learning on the Constraint Manifold: Theory and Applications
par: Liu, Puze, et autres
Publié: (2024) -
Many of Your DPOs are Secretly One: Attempting Unification Through Mutual Information
par: Tutnov, Rasul, et autres
Publié: (2025) -
Al-Khwarizmi: Discovering Physical Laws with Foundation Models
par: Mower, Christopher E., et autres
Publié: (2025) -
Contextual Causal Bayesian Optimisation
par: Arsenyan, Vahan, et autres
Publié: (2023) -
Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates
par: Diwan, Anish, et autres
Publié: (2026)