Stochastic Q-learning for Large Discrete Action Spaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Fourati, Fares, Aggarwal, Vaneet, Alouini, Mohamed-Slim |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ECPv2: Fast, Efficient, and Scalable Global Optimization of Lipschitz Functions
di: Fourati, Fares, et al.
Pubblicazione: (2025)
di: Fourati, Fares, et al.
Pubblicazione: (2025)
Federated Combinatorial Multi-Agent Multi-Armed Bandits
di: Fourati, Fares, et al.
Pubblicazione: (2024)
di: Fourati, Fares, et al.
Pubblicazione: (2024)
Every Call is Precious: Global Optimization of Black-Box Functions with Unknown Lipschitz Constants
di: Fourati, Fares, et al.
Pubblicazione: (2025)
di: Fourati, Fares, et al.
Pubblicazione: (2025)
FilFL: Client Filtering for Optimized Client Participation in Federated Learning
di: Fourati, Fares, et al.
Pubblicazione: (2023)
di: Fourati, Fares, et al.
Pubblicazione: (2023)
Label-Efficient School Detection from Aerial Imagery via Weakly Supervised Pretraining and Fine-Tuning
di: Elmimouni, Zakarya, et al.
Pubblicazione: (2026)
di: Elmimouni, Zakarya, et al.
Pubblicazione: (2026)
Retrieval-Augmented Generation for Reliable Interpretation of Radio Regulations
di: Kassimi, Zakaria El, et al.
Pubblicazione: (2025)
di: Kassimi, Zakaria El, et al.
Pubblicazione: (2025)
Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds
di: Zhang, Jiefu, et al.
Pubblicazione: (2026)
di: Zhang, Jiefu, et al.
Pubblicazione: (2026)
A Coherence-Based Measure of AGI
di: Fourati, Fares
Pubblicazione: (2025)
di: Fourati, Fares
Pubblicazione: (2025)
Dynamic Obstacle Avoidance through Uncertainty-Based Adaptive Planning with Diffusion
di: Punyamoorty, Vineet, et al.
Pubblicazione: (2024)
di: Punyamoorty, Vineet, et al.
Pubblicazione: (2024)
Discrete State Diffusion Models: A Sample Complexity Perspective
di: Srikanth, Aadithya, et al.
Pubblicazione: (2025)
di: Srikanth, Aadithya, et al.
Pubblicazione: (2025)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
di: Liu, Guangda, et al.
Pubblicazione: (2024)
di: Liu, Guangda, et al.
Pubblicazione: (2024)
Q-learning with Adjoint Matching
di: Li, Qiyang, et al.
Pubblicazione: (2026)
di: Li, Qiyang, et al.
Pubblicazione: (2026)
Fairness in Serving Large Language Models
di: Sheng, Ying, et al.
Pubblicazione: (2023)
di: Sheng, Ying, et al.
Pubblicazione: (2023)
Efficient $Q$-Learning and Actor-Critic Methods for Robust Average Reward Reinforcement Learning
di: Xu, Yang, et al.
Pubblicazione: (2025)
di: Xu, Yang, et al.
Pubblicazione: (2025)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
di: Hossain, Md Arafat, et al.
Pubblicazione: (2025)
Stochastic Submodular Bandits with Delayed Composite Anonymous Bandit Feedback
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2023)
di: Pedramfar, Mohammad, et al.
Pubblicazione: (2023)
Deploying Open-Source Large Language Models: A performance Analysis
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
di: Bendi-Ouis, Yannis, et al.
Pubblicazione: (2024)
Characterizing VLA Models: Identifying the Action Generation Bottleneck for Edge AI Architectures
di: Vishwanathan, Manoj, et al.
Pubblicazione: (2026)
di: Vishwanathan, Manoj, et al.
Pubblicazione: (2026)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
di: Zhao, Youpeng, et al.
Pubblicazione: (2024)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
di: Jha, Mayank
Pubblicazione: (2026)
di: Jha, Mayank
Pubblicazione: (2026)
Comment on paper: Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman Problems
di: Min, Yimeng
Pubblicazione: (2024)
di: Min, Yimeng
Pubblicazione: (2024)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
di: Zhao, Yushang, et al.
Pubblicazione: (2025)
Coarse-to-fine Q-Network with Action Sequence for Data-Efficient Reinforcement Learning
di: Seo, Younggyo, et al.
Pubblicazione: (2024)
di: Seo, Younggyo, et al.
Pubblicazione: (2024)
Wireless Traffic Prediction with Large Language Model
di: Zhang, Chuanting, et al.
Pubblicazione: (2025)
di: Zhang, Chuanting, et al.
Pubblicazione: (2025)
DIAR: Diffusion-model-guided Implicit Q-learning with Adaptive Revaluation
di: Park, Jaehyun, et al.
Pubblicazione: (2024)
di: Park, Jaehyun, et al.
Pubblicazione: (2024)
A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
di: Ellis-Mohr, Austin R., et al.
Pubblicazione: (2025)
di: Ellis-Mohr, Austin R., et al.
Pubblicazione: (2025)
Sample Complexity Analysis for Constrained Bilevel Reinforcement Learning
di: Saxena, Naman, et al.
Pubblicazione: (2026)
di: Saxena, Naman, et al.
Pubblicazione: (2026)
AUV Trajectory Learning for Underwater Acoustic Energy Transfer and Age Minimization
di: Melki, Mohamed Afouene, et al.
Pubblicazione: (2026)
di: Melki, Mohamed Afouene, et al.
Pubblicazione: (2026)
Predicting Configuration Performance in Multiple Environments with Sequential Meta-learning
di: Gong, Jingzhi, et al.
Pubblicazione: (2024)
di: Gong, Jingzhi, et al.
Pubblicazione: (2024)
DEAS: DEtached value learning with Action Sequence for Scalable Offline RL
di: Kim, Changyeon, et al.
Pubblicazione: (2025)
di: Kim, Changyeon, et al.
Pubblicazione: (2025)
BenchRL-QAS: Benchmarking reinforcement learning algorithms for quantum architecture search
di: Ikhtiarudin, Azhar, et al.
Pubblicazione: (2025)
di: Ikhtiarudin, Azhar, et al.
Pubblicazione: (2025)
SLAC: Simulation-Pretrained Latent Action Space for Whole-Body Real-World RL
di: Hu, Jiaheng, et al.
Pubblicazione: (2025)
di: Hu, Jiaheng, et al.
Pubblicazione: (2025)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
di: Mozaffari, Mohammad, et al.
Pubblicazione: (2024)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
di: Shkolnik, Moran, et al.
Pubblicazione: (2024)
APOLLO: SGD-like Memory, AdamW-level Performance
di: Zhu, Hanqing, et al.
Pubblicazione: (2024)
di: Zhu, Hanqing, et al.
Pubblicazione: (2024)
FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system
di: Li, Zeyuan, et al.
Pubblicazione: (2024)
di: Li, Zeyuan, et al.
Pubblicazione: (2024)
Applied Federated Model Personalisation in the Industrial Domain: A Comparative Study
di: Siniosoglou, Ilias, et al.
Pubblicazione: (2024)
di: Siniosoglou, Ilias, et al.
Pubblicazione: (2024)
The Power of Training: How Different Neural Network Setups Influence the Energy Demand
di: Geißler, Daniel, et al.
Pubblicazione: (2024)
di: Geißler, Daniel, et al.
Pubblicazione: (2024)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
di: Shao, Zishan, et al.
Pubblicazione: (2025)
di: Shao, Zishan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ECPv2: Fast, Efficient, and Scalable Global Optimization of Lipschitz Functions
di: Fourati, Fares, et al.
Pubblicazione: (2025) -
Federated Combinatorial Multi-Agent Multi-Armed Bandits
di: Fourati, Fares, et al.
Pubblicazione: (2024) -
Every Call is Precious: Global Optimization of Black-Box Functions with Unknown Lipschitz Constants
di: Fourati, Fares, et al.
Pubblicazione: (2025) -
FilFL: Client Filtering for Optimized Client Participation in Federated Learning
di: Fourati, Fares, et al.
Pubblicazione: (2023) -
Label-Efficient School Detection from Aerial Imagery via Weakly Supervised Pretraining and Fine-Tuning
di: Elmimouni, Zakarya, et al.
Pubblicazione: (2026)