Discrete Markov Bridge
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Hengli, Wang, Yuxuan, Zhu, Song-Chun, Wu, Ying Nian, Zheng, Zilong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
di: Li, Hengli, et al.
Pubblicazione: (2025)
di: Li, Hengli, et al.
Pubblicazione: (2025)
Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspective
di: Kang, Yipeng, et al.
Pubblicazione: (2024)
di: Kang, Yipeng, et al.
Pubblicazione: (2024)
How to Synthesize Text Data without Model Collapse?
di: Zhu, Xuekai, et al.
Pubblicazione: (2024)
di: Zhu, Xuekai, et al.
Pubblicazione: (2024)
Learning to Rank Chain-of-Thought: Using a Small Model
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
Mars: Situated Inductive Reasoning in an Open-World Environment
di: Tang, Xiaojuan, et al.
Pubblicazione: (2024)
di: Tang, Xiaojuan, et al.
Pubblicazione: (2024)
Thoth: Mid-Training Bridges LLMs to Time Series Understanding
di: Lin, Jiafeng, et al.
Pubblicazione: (2026)
di: Lin, Jiafeng, et al.
Pubblicazione: (2026)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
Parameter-Efficient Fine-Tuning with Discrete Fourier Transform
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
di: Gao, Ziqi, et al.
Pubblicazione: (2024)
Analysis of Error Sources in LLM-based Hypothesis Search for Few-Shot Rule Induction
di: Parab, Aishni, et al.
Pubblicazione: (2025)
di: Parab, Aishni, et al.
Pubblicazione: (2025)
MarkovScale: Towards Optimal Sequential Scaling at Inference Time
di: Wang, Youkang, et al.
Pubblicazione: (2026)
di: Wang, Youkang, et al.
Pubblicazione: (2026)
Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees
di: Wu, Yongtao, et al.
Pubblicazione: (2025)
di: Wu, Yongtao, et al.
Pubblicazione: (2025)
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
di: Zhao, Andrew, et al.
Pubblicazione: (2025)
di: Zhao, Andrew, et al.
Pubblicazione: (2025)
DLP-LoRA: Efficient Task-Specific LoRA Fusion with a Dynamic, Lightweight Plugin for Large Language Models
di: Zhang, Yuxuan, et al.
Pubblicazione: (2024)
di: Zhang, Yuxuan, et al.
Pubblicazione: (2024)
Atom of Thoughts for Markov LLM Test-Time Scaling
di: Teng, Fengwei, et al.
Pubblicazione: (2025)
di: Teng, Fengwei, et al.
Pubblicazione: (2025)
To be Continuous, or to be Discrete, Those are Bits of Questions
di: Wang, Yiran, et al.
Pubblicazione: (2024)
di: Wang, Yiran, et al.
Pubblicazione: (2024)
Heterogeneous Value Alignment Evaluation for Large Language Models
di: Zhang, Zhaowei, et al.
Pubblicazione: (2023)
di: Zhang, Zhaowei, et al.
Pubblicazione: (2023)
The Price of Format: Diversity Collapse in LLMs
di: Yun, Longfei, et al.
Pubblicazione: (2025)
di: Yun, Longfei, et al.
Pubblicazione: (2025)
EnvBridge: Bridging Diverse Environments with Cross-Environment Knowledge Transfer for Embodied AI
di: Kagaya, Tomoyuki, et al.
Pubblicazione: (2024)
di: Kagaya, Tomoyuki, et al.
Pubblicazione: (2024)
Non-Markovian Discrete Diffusion with Causal Language Models
di: Zhang, Yangtian, et al.
Pubblicazione: (2025)
di: Zhang, Yangtian, et al.
Pubblicazione: (2025)
SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation
di: Yang, Wenjie, et al.
Pubblicazione: (2025)
di: Yang, Wenjie, et al.
Pubblicazione: (2025)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
di: Li, Yanshi, et al.
Pubblicazione: (2024)
di: Li, Yanshi, et al.
Pubblicazione: (2024)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
Bridge-IF: Learning Inverse Protein Folding with Markov Bridges
di: Zhu, Yiheng, et al.
Pubblicazione: (2024)
di: Zhu, Yiheng, et al.
Pubblicazione: (2024)
Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
di: Yang, Zhihe, et al.
Pubblicazione: (2025)
Large Language Models as Markov Chains
di: Zekri, Oussama, et al.
Pubblicazione: (2024)
di: Zekri, Oussama, et al.
Pubblicazione: (2024)
Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct
di: Zheng, Haoyang, et al.
Pubblicazione: (2025)
di: Zheng, Haoyang, et al.
Pubblicazione: (2025)
From Self-Attention to Markov Models: Unveiling the Dynamics of Generative Transformers
di: Ildiz, M. Emrullah, et al.
Pubblicazione: (2024)
di: Ildiz, M. Emrullah, et al.
Pubblicazione: (2024)
Position Engineering: Boosting Large Language Models through Positional Information Manipulation
di: He, Zhiyuan, et al.
Pubblicazione: (2024)
di: He, Zhiyuan, et al.
Pubblicazione: (2024)
A Markov Categorical Framework for Language Modeling
di: Zhang, Yifan
Pubblicazione: (2025)
di: Zhang, Yifan
Pubblicazione: (2025)
Markov Constraint as Large Language Model Surrogate
di: Bonlarron, Alexandre, et al.
Pubblicazione: (2024)
di: Bonlarron, Alexandre, et al.
Pubblicazione: (2024)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
Generalized Interpolating Discrete Diffusion
di: von Rütte, Dimitri, et al.
Pubblicazione: (2025)
di: von Rütte, Dimitri, et al.
Pubblicazione: (2025)
Unifying Continuous and Discrete Text Diffusion with Non-simultaneous Diffusion Processes
di: Li, Bocheng, et al.
Pubblicazione: (2025)
di: Li, Bocheng, et al.
Pubblicazione: (2025)
Bridging the Gap Between Preference Alignment and Machine Unlearning
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
di: Feng, Xiaohua, et al.
Pubblicazione: (2025)
SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation
di: Guo, Shuhan, et al.
Pubblicazione: (2024)
di: Guo, Shuhan, et al.
Pubblicazione: (2024)
DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster
di: Qi, Ji, et al.
Pubblicazione: (2025)
di: Qi, Ji, et al.
Pubblicazione: (2025)
Evaluating the Correctness of Inference Patterns Used by LLMs for Judgment
di: Chen, Lu, et al.
Pubblicazione: (2024)
di: Chen, Lu, et al.
Pubblicazione: (2024)
Aura: Universal Multi-dimensional Exogenous Integration for Aviation Time Series
di: Lin, Jiafeng, et al.
Pubblicazione: (2026)
di: Lin, Jiafeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
di: Li, Hengli, et al.
Pubblicazione: (2025) -
Are the Values of LLMs Structurally Aligned with Humans? A Causal Perspective
di: Kang, Yipeng, et al.
Pubblicazione: (2024) -
How to Synthesize Text Data without Model Collapse?
di: Zhu, Xuekai, et al.
Pubblicazione: (2024) -
Learning to Rank Chain-of-Thought: Using a Small Model
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025) -
Mars: Situated Inductive Reasoning in an Open-World Environment
di: Tang, Xiaojuan, et al.
Pubblicazione: (2024)