Guardado en:
| Autores principales: | Huang, Lianghuan, Anupam, Sagnik, Lee, Insup, Li, Shuo, Bastani, Osbert |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.03515 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Effective Reinforcement Learning for Reasoning in Language Models
por: Huang, Lianghuan, et al.
Publicado: (2025)
por: Huang, Lianghuan, et al.
Publicado: (2025)
LLM Program Optimization via Retrieval Augmented Search
por: Anupam, Sagnik, et al.
Publicado: (2025)
por: Anupam, Sagnik, et al.
Publicado: (2025)
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
por: Si, Wenwen, et al.
Publicado: (2025)
por: Si, Wenwen, et al.
Publicado: (2025)
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
por: Anupam, Sagnik, et al.
Publicado: (2025)
por: Anupam, Sagnik, et al.
Publicado: (2025)
Uncertainty in Language Models: Assessment through Rank-Calibration
por: Huang, Xinmeng, et al.
Publicado: (2024)
por: Huang, Xinmeng, et al.
Publicado: (2024)
Rethinking Algorithmic Fairness for Human-AI Collaboration
por: Ge, Haosen, et al.
Publicado: (2023)
por: Ge, Haosen, et al.
Publicado: (2023)
Improving Human Sequential Decision-Making with Reinforcement Learning
por: Bastani, Hamsa, et al.
Publicado: (2021)
por: Bastani, Hamsa, et al.
Publicado: (2021)
WST: Weak-to-Strong Knowledge Transfer via Reinforcement Learning
por: Ge, Haosen, et al.
Publicado: (2025)
por: Ge, Haosen, et al.
Publicado: (2025)
Asymptotic Normality of Generalized Low-Rank Matrix Sensing via Riemannian Geometry
por: Bastani, Osbert
Publicado: (2024)
por: Bastani, Osbert
Publicado: (2024)
Conformal Structured Prediction
por: Zhang, Botong, et al.
Publicado: (2024)
por: Zhang, Botong, et al.
Publicado: (2024)
SeekerGym: A Benchmark for Reliable Information Seeking
por: Kim, Remy, et al.
Publicado: (2026)
por: Kim, Remy, et al.
Publicado: (2026)
TRAQ: Trustworthy Retrieval Augmented Question Answering via Conformal Prediction
por: Li, Shuo, et al.
Publicado: (2023)
por: Li, Shuo, et al.
Publicado: (2023)
Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning
por: Si, Wenwen, et al.
Publicado: (2026)
por: Si, Wenwen, et al.
Publicado: (2026)
Stochastic Online Conformal Prediction with Semi-Bandit Feedback
por: Ge, Haosen, et al.
Publicado: (2024)
por: Ge, Haosen, et al.
Publicado: (2024)
Group-Sparse Matrix Factorization for Transfer Learning of Word Embeddings
por: Xu, Kan, et al.
Publicado: (2021)
por: Xu, Kan, et al.
Publicado: (2021)
Beating the Winner's Curse via Inference-Aware Policy Optimization
por: Bastani, Hamsa, et al.
Publicado: (2025)
por: Bastani, Hamsa, et al.
Publicado: (2025)
Winner's Curse Drives False Promises in Data-Driven Decisions: A Case Study in Refugee Matching
por: Bastani, Hamsa, et al.
Publicado: (2026)
por: Bastani, Hamsa, et al.
Publicado: (2026)
One-Shot Safety Alignment for Large Language Models via Optimal Dualization
por: Huang, Xinmeng, et al.
Publicado: (2024)
por: Huang, Xinmeng, et al.
Publicado: (2024)
SPARLING: Learning Latent Representations with Extremely Sparse Activations
por: Gupta, Kavi, et al.
Publicado: (2023)
por: Gupta, Kavi, et al.
Publicado: (2023)
Stochastic Bandits with ReLU Neural Networks
por: Xu, Kan, et al.
Publicado: (2024)
por: Xu, Kan, et al.
Publicado: (2024)
Diversity By Design: Leveraging Distribution Matching for Offline Model-Based Optimization
por: Yao, Michael S., et al.
Publicado: (2025)
por: Yao, Michael S., et al.
Publicado: (2025)
Uncertainty Quantification for Neurosymbolic Programs via Compositional Conformal Prediction
por: Ramalingam, Ramya, et al.
Publicado: (2024)
por: Ramalingam, Ramya, et al.
Publicado: (2024)
Prior-Agnostic Incentive-Compatible Exploration
por: Ramalingam, Ramya, et al.
Publicado: (2026)
por: Ramalingam, Ramya, et al.
Publicado: (2026)
Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
por: Mukherjee, Sagnik, et al.
Publicado: (2025)
por: Mukherjee, Sagnik, et al.
Publicado: (2025)
Generative Adversarial Model-Based Optimization via Source Critic Regularization
por: Yao, Michael S., et al.
Publicado: (2024)
por: Yao, Michael S., et al.
Publicado: (2024)
Alignment of large language models with constrained learning
por: Zhang, Botong, et al.
Publicado: (2025)
por: Zhang, Botong, et al.
Publicado: (2025)
Knowledgeable Language Models as Black-Box Optimizers for Personalized Medicine
por: Yao, Michael S., et al.
Publicado: (2025)
por: Yao, Michael S., et al.
Publicado: (2025)
Causality $\neq$ Decodability, and Vice Versa: Lessons from Interpreting Counting ViTs
por: Huang, Lianghuan, et al.
Publicado: (2025)
por: Huang, Lianghuan, et al.
Publicado: (2025)
Improving Structural Diversity of Blackbox LLMs via Chain-of-Specification Prompting
por: Young, Halley, et al.
Publicado: (2024)
por: Young, Halley, et al.
Publicado: (2024)
A Fast, Reliable, and Secure Programming Language for LLM Agents with Code Actions
por: Mell, Stephen, et al.
Publicado: (2025)
por: Mell, Stephen, et al.
Publicado: (2025)
Eurekaverse: Environment Curriculum Generation via Large Language Models
por: Liang, William, et al.
Publicado: (2024)
por: Liang, William, et al.
Publicado: (2024)
Monitor and Recover: A Paradigm for Future Research on Distribution Shift in Learning-Enabled Cyber-Physical Systems
por: Lin, Vivian, et al.
Publicado: (2025)
por: Lin, Vivian, et al.
Publicado: (2025)
Quantifying and Improving Adaptivity in Conformal Prediction through Input Transformations
por: Jang, Sooyong, et al.
Publicado: (2025)
por: Jang, Sooyong, et al.
Publicado: (2025)
Eureka: Human-Level Reward Design via Coding Large Language Models
por: Ma, Yecheng Jason, et al.
Publicado: (2023)
por: Ma, Yecheng Jason, et al.
Publicado: (2023)
DrEureka: Language Model Guided Sim-To-Real Transfer
por: Ma, Yecheng Jason, et al.
Publicado: (2024)
por: Ma, Yecheng Jason, et al.
Publicado: (2024)
MathDSL: A Domain-Specific Language for Concise Mathematical Solutions Via Program Synthesis
por: Anupam, Sagnik, et al.
Publicado: (2024)
por: Anupam, Sagnik, et al.
Publicado: (2024)
Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria
por: Yao, Michael S., et al.
Publicado: (2024)
por: Yao, Michael S., et al.
Publicado: (2024)
IBCL: Zero-shot Model Generation under Stability-Plasticity Trade-offs
por: Lu, Pengyuan, et al.
Publicado: (2023)
por: Lu, Pengyuan, et al.
Publicado: (2023)
Pattern-Guided Diffusion Models
por: Lin, Vivian, et al.
Publicado: (2025)
por: Lin, Vivian, et al.
Publicado: (2025)
Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement
por: Zhang, Xuechen, et al.
Publicado: (2025)
por: Zhang, Xuechen, et al.
Publicado: (2025)
Ejemplares similares
-
Effective Reinforcement Learning for Reasoning in Language Models
por: Huang, Lianghuan, et al.
Publicado: (2025) -
LLM Program Optimization via Retrieval Augmented Search
por: Anupam, Sagnik, et al.
Publicado: (2025) -
Conformal Constrained Policy Optimization for Cost-Effective LLM Agents
por: Si, Wenwen, et al.
Publicado: (2025) -
BrowserArena: Evaluating LLM Agents on Real-World Web Navigation Tasks
por: Anupam, Sagnik, et al.
Publicado: (2025) -
Uncertainty in Language Models: Assessment through Rank-Calibration
por: Huang, Xinmeng, et al.
Publicado: (2024)