Thyme: Think Beyond Images
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yi-Fan, Lu, Xingyu, Yin, Shukang, Fu, Chaoyou, Chen, Wei, Hu, Xiao, Wen, Bin, Jiang, Kaiyu, Liu, Changyi, Zhang, Tianke, Fan, Haonan, Chen, Kaibing, Chen, Jiankang, Ding, Haojie, Tang, Kaiyu, Zhang, Zhang, Wang, Liang, Yang, Fan, Gao, Tingting, Zhou, Guorui |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025)
by: Zhang, Yi-Fan, et al.
Published: (2025)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
by: Liu, Wenqi, et al.
Published: (2026)
by: Liu, Wenqi, et al.
Published: (2026)
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
by: Yang, Yankai, et al.
Published: (2026)
by: Yang, Yankai, et al.
Published: (2026)
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
by: Long, Yancheng, et al.
Published: (2026)
by: Long, Yancheng, et al.
Published: (2026)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
by: Lu, Xingyu, et al.
Published: (2026)
by: Lu, Xingyu, et al.
Published: (2026)
VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform
by: Lu, Xingyu, et al.
Published: (2025)
by: Lu, Xingyu, et al.
Published: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
by: Chen, Jiankang, et al.
Published: (2025)
by: Chen, Jiankang, et al.
Published: (2025)
InstructEngine: Instruction-driven Text-to-Image Alignment
by: Lu, Xingyu, et al.
Published: (2025)
by: Lu, Xingyu, et al.
Published: (2025)
UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing
by: Wei, Hongyang, et al.
Published: (2026)
by: Wei, Hongyang, et al.
Published: (2026)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
by: Lu, Xingyu, et al.
Published: (2026)
by: Lu, Xingyu, et al.
Published: (2026)
Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning
by: Hu, Xiao, et al.
Published: (2025)
by: Hu, Xiao, et al.
Published: (2025)
Kwai-STaR: Transform LLMs into State-Transition Reasoners
by: Lu, Xingyu, et al.
Published: (2024)
by: Lu, Xingyu, et al.
Published: (2024)
TimeBrush : An Intelligent Expert System for Restoring Historical Images With Temporal and Stylistic Guidance
by: Kaiyu Zhang
Published: (2025)
by: Kaiyu Zhang
Published: (2025)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
by: Zhang, Yi-Fan, et al.
Published: (2024)
by: Zhang, Yi-Fan, et al.
Published: (2024)
EVLM: An Efficient Vision-Language Model for Visual Understanding
by: Chen, Kaibing, et al.
Published: (2024)
by: Chen, Kaibing, et al.
Published: (2024)
MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding
by: Zhao, Sirui, et al.
Published: (2025)
by: Zhao, Sirui, et al.
Published: (2025)
PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning
by: Wang, Yunxiao, et al.
Published: (2025)
by: Wang, Yunxiao, et al.
Published: (2025)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
by: Zhang, Xue, et al.
Published: (2025)
by: Zhang, Xue, et al.
Published: (2025)
Tango: Taming Visual Signals for Efficient Video Large Language Models
by: Yin, Shukang, et al.
Published: (2026)
by: Yin, Shukang, et al.
Published: (2026)
A Survey on Multimodal Large Language Models
by: Yin, Shukang, et al.
Published: (2023)
by: Yin, Shukang, et al.
Published: (2023)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
by: He, Kaiyu, et al.
Published: (2025)
by: He, Kaiyu, et al.
Published: (2025)
Kwai Keye-VL 1.5 Technical Report
by: Yang, Biao, et al.
Published: (2025)
by: Yang, Biao, et al.
Published: (2025)
Polymer‐MOF Network Enabling Ultrathin Coating for Post‐Combustion Carbon Capture
by: Shuting Fan, et al.
Published: (2024)
by: Shuting Fan, et al.
Published: (2024)
Polymer‐MOF Network Enabling Ultrathin Coating for Post‐Combustion Carbon Capture
by: Shuting Fan, et al.
Published: (2024)
by: Shuting Fan, et al.
Published: (2024)
The Impact of GenAI ‐Based Collaborative Inquiry on Critical Thinking in Argumentation: A Case Study of Blended Argumentative Writing Pedagogy
by: Jing Chen, et al.
Published: (2025)
by: Jing Chen, et al.
Published: (2025)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
by: Gu, Xin, et al.
Published: (2025)
by: Gu, Xin, et al.
Published: (2025)
Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
by: Chen, Wei, et al.
Published: (2026)
by: Chen, Wei, et al.
Published: (2026)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025)
by: Xie, Wulin, et al.
Published: (2025)
TIPSEMS ‐ VB Trial Reappraised: Infection Control, HE Prophylaxis, and Ischemic Hepatitis Considerations
by: Kaiyu Bian, et al.
Published: (2025)
by: Kaiyu Bian, et al.
Published: (2025)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
by: Liu, Ruohan, et al.
Published: (2026)
by: Liu, Ruohan, et al.
Published: (2026)
The Effect of Design Thinking on Creative & Innovation Processes: An Empirical Study Across Different Design Experience Levels
by: Zhang, Yuxin, et al.
Published: (2026)
by: Zhang, Yuxin, et al.
Published: (2026)
Kwai Keye-VL Technical Report
by: Kwai Keye Team, et al.
Published: (2025)
by: Kwai Keye Team, et al.
Published: (2025)
Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models
by: Chen, Wei, et al.
Published: (2025)
by: Chen, Wei, et al.
Published: (2025)
Accelerating Historical K-Core Search in Temporal Graphs
by: Ma, Zhuo, et al.
Published: (2025)
by: Ma, Zhuo, et al.
Published: (2025)
L-Drive: Beyond a Single Mapping-Latent Context Drives Time Series Forecasting
by: Zhang, Fan, et al.
Published: (2026)
by: Zhang, Fan, et al.
Published: (2026)
Relativistic $^3$He light-front wave function
by: Karmanov, V. A., et al.
Published: (2025)
by: Karmanov, V. A., et al.
Published: (2025)
Helium-3 relativistic wave function in light-front dynamics
by: Zhu, Zhimin, et al.
Published: (2026)
by: Zhu, Zhimin, et al.
Published: (2026)
Proving Olympiad Inequalities by Synergizing LLMs and Symbolic Reasoning
by: Li, Zenan, et al.
Published: (2025)
by: Li, Zenan, et al.
Published: (2025)
Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers
by: He, Kaiyu, et al.
Published: (2026)
by: He, Kaiyu, et al.
Published: (2026)
Similar Items
-
R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning
by: Zhang, Yi-Fan, et al.
Published: (2025) -
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
by: Liu, Wenqi, et al.
Published: (2026) -
Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models
by: Yang, Yankai, et al.
Published: (2026) -
SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning
by: Long, Yancheng, et al.
Published: (2026) -
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
by: Lu, Xingyu, et al.
Published: (2026)