Temporal Sampling for Forgotten Reasoning in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yuetai, Xu, Zhangchen, Jiang, Fengqing, Ramasubramanian, Bhaskar, Niu, Luyao, Lin, Bill Yuchen, Yue, Xiang, Poovendran, Radha |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning
par: Xu, Zhangchen, et autres
Publié: (2025)
par: Xu, Zhangchen, et autres
Publié: (2025)
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
par: Feng, Yichen, et autres
Publié: (2025)
par: Feng, Yichen, et autres
Publié: (2025)
Small Models Struggle to Learn from Strong Reasoners
par: Li, Yuetai, et autres
Publié: (2025)
par: Li, Yuetai, et autres
Publié: (2025)
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
par: Li, Yuetai, et autres
Publié: (2024)
par: Li, Yuetai, et autres
Publié: (2024)
SoSBench: Benchmarking Safety Alignment on Six Scientific Domains
par: Jiang, Fengqing, et autres
Publié: (2025)
par: Jiang, Fengqing, et autres
Publié: (2025)
The WidthWall: A Strict Expressivity Hierarchy for Hypergraph Neural Networks
par: Jiang, Fengqing, et autres
Publié: (2026)
par: Jiang, Fengqing, et autres
Publié: (2026)
ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs
par: Jiang, Fengqing, et autres
Publié: (2024)
par: Jiang, Fengqing, et autres
Publié: (2024)
SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities
par: Jiang, Fengqing, et autres
Publié: (2025)
par: Jiang, Fengqing, et autres
Publié: (2025)
Stronger Models are NOT Stronger Teachers for Instruction Tuning
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
ACE: A Model Poisoning Attack on Contribution Evaluation Methods in Federated Learning
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Brave: Byzantine-Resilient and Privacy-Preserving Peer-to-Peer Federated Learning
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Polyhedral Instability Governs Regret in Online Learning
par: Li, Yuetai, et autres
Publié: (2026)
par: Li, Yuetai, et autres
Publié: (2026)
BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?
par: Jiang, Fengqing, et autres
Publié: (2025)
par: Jiang, Fengqing, et autres
Publié: (2025)
ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning
par: Lin, Bill Yuchen, et autres
Publié: (2025)
par: Lin, Bill Yuchen, et autres
Publié: (2025)
A Method for Fast Autonomy Transfer in Reinforcement Learning
par: Sahabandu, Dinuka, et autres
Publié: (2024)
par: Sahabandu, Dinuka, et autres
Publié: (2024)
Double-Dip: Thwarting Label-Only Membership Inference Attacks with Transfer Learning and Randomization
par: Rajabi, Arezoo, et autres
Publié: (2024)
par: Rajabi, Arezoo, et autres
Publié: (2024)
BadChain: Backdoor Chain-of-Thought Prompting for Large Language Models
par: Xiang, Zhen, et autres
Publié: (2024)
par: Xiang, Zhen, et autres
Publié: (2024)
KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding
par: Xu, Zhangchen, et autres
Publié: (2025)
par: Xu, Zhangchen, et autres
Publié: (2025)
Simulating Environments with Reasoning Models for Agent Training
par: Li, Yuetai, et autres
Publié: (2025)
par: Li, Yuetai, et autres
Publié: (2025)
Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors
par: Sahabandu, Dinuka, et autres
Publié: (2024)
par: Sahabandu, Dinuka, et autres
Publié: (2024)
TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments
par: Xu, Zhangchen, et autres
Publié: (2025)
par: Xu, Zhangchen, et autres
Publié: (2025)
Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?
par: Feng, Yichen, et autres
Publié: (2026)
par: Feng, Yichen, et autres
Publié: (2026)
JobBench: Aligning Agent Work With Human Will
par: Li, Yuetai, et autres
Publié: (2026)
par: Li, Yuetai, et autres
Publié: (2026)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
par: Huan, Maggie, et autres
Publié: (2025)
par: Huan, Maggie, et autres
Publié: (2025)
Temporal Imbalance of Positive and Negative Supervision in Class-Incremental Learning
par: Ma, Jinge, et autres
Publié: (2026)
par: Ma, Jinge, et autres
Publié: (2026)
Fault Tolerant Neural Control Barrier Functions for Robotic Systems under Sensor Faults and Attacks
par: Zhang, Hongchao, et autres
Publié: (2024)
par: Zhang, Hongchao, et autres
Publié: (2024)
The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection
par: Hu, Zhengyu, et autres
Publié: (2026)
par: Hu, Zhengyu, et autres
Publié: (2026)
Distributed Safety-Critical Control of Multi-Agent Systems with Time-Varying Communication Topologies
par: Cheng, Shiyu, et autres
Publié: (2026)
par: Cheng, Shiyu, et autres
Publié: (2026)
Modeling and Designing Non-Pharmaceutical Interventions in Epidemics: A Submodular Approach
par: Cheng, Shiyu, et autres
Publié: (2024)
par: Cheng, Shiyu, et autres
Publié: (2024)
Swarm-STL: A Framework for Motion Planning in Large-Scale, Multi-Swarm Systems
par: Cheng, Shiyu, et autres
Publié: (2025)
par: Cheng, Shiyu, et autres
Publié: (2025)
ST-ProC: A Graph-Prototypical Framework for Robust Semi-Supervised Travel Mode Identification
par: Niu, Luyao, et autres
Publié: (2025)
par: Niu, Luyao, et autres
Publié: (2025)
Event-CausNet: Unlocking Causal Knowledge from Text with Large Language Models for Reliable Spatio-Temporal Forecasting
par: Niu, Luyao, et autres
Publié: (2025)
par: Niu, Luyao, et autres
Publié: (2025)
Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents
par: Song, Yifan, et autres
Publié: (2024)
par: Song, Yifan, et autres
Publié: (2024)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
par: Liu, Zheyuan, et autres
Publié: (2025)
par: Liu, Zheyuan, et autres
Publié: (2025)
Composite Learning Units: Generalized Learning Beyond Parameter Updates to Transform LLMs into Adaptive Reasoners
par: Radha, Santosh Kumar, et autres
Publié: (2024)
par: Radha, Santosh Kumar, et autres
Publié: (2024)
Learning to Reason Over Time: Timeline Self-Reflection for Improved Temporal Reasoning in Language Models
par: Bazaga, Adrián, et autres
Publié: (2025)
par: Bazaga, Adrián, et autres
Publié: (2025)
Who is Responsible? Explaining Safety Violations in Multi-Agent Cyber-Physical Systems
par: Niu, Luyao, et autres
Publié: (2024)
par: Niu, Luyao, et autres
Publié: (2024)
Documents similaires
-
TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning
par: Xu, Zhangchen, et autres
Publié: (2025) -
VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL
par: Feng, Yichen, et autres
Publié: (2025) -
Small Models Struggle to Learn from Strong Reasoners
par: Li, Yuetai, et autres
Publié: (2025) -
ChatBug: A Common Vulnerability of Aligned LLMs Induced by Chat Templates
par: Jiang, Fengqing, et autres
Publié: (2024) -
CleanGen: Mitigating Backdoor Attacks for Generation Tasks in Large Language Models
par: Li, Yuetai, et autres
Publié: (2024)