RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Jialiang, Zhang, Gongrui, Ma, Xiaolong, Xu, Lin, Zhang, Miaosen, Yang, Ruiqi, Wang, Song, Qiu, Kai, Wu, Zhirong, Dai, Qi, Ma, Ruichun, Liu, Bei, Yang, Yifan, Luo, Chong, Yang, Zhengyuan, Li, Linjie, Wang, Lijuan, Chen, Weizhu, Geng, Xin, Guo, Baining |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
InfoAgent: Advancing Autonomous Information-Seeking Agents
por: Zhang, Gongrui, et al.
Publicado: (2025)
por: Zhang, Gongrui, et al.
Publicado: (2025)
MageBench: Bridging Large Multimodal Models to Agents
por: Zhang, Miaosen, et al.
Publicado: (2024)
por: Zhang, Miaosen, et al.
Publicado: (2024)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
por: Zhang, Miaosen, et al.
Publicado: (2025)
por: Zhang, Miaosen, et al.
Publicado: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
por: Peng, Yingzhe, et al.
Publicado: (2025)
por: Peng, Yingzhe, et al.
Publicado: (2025)
NJUST-KMG at TRAC-2024 Tasks 1 and 2: Offline Harm Potential Identification
por: Wang, Jingyuan, et al.
Publicado: (2024)
por: Wang, Jingyuan, et al.
Publicado: (2024)
Fast TRAC: A Parameter-Free Optimizer for Lifelong Reinforcement Learning
por: Muppidi, Aneesh, et al.
Publicado: (2024)
por: Muppidi, Aneesh, et al.
Publicado: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
por: Cho, Jaemin, et al.
Publicado: (2023)
por: Cho, Jaemin, et al.
Publicado: (2023)
Bring Metric Functions into Diffusion Models
por: An, Jie, et al.
Publicado: (2024)
por: An, Jie, et al.
Publicado: (2024)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
por: Zhang, Miaosen, et al.
Publicado: (2024)
por: Zhang, Miaosen, et al.
Publicado: (2024)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
por: Hao, Yunzhuo, et al.
Publicado: (2025)
por: Hao, Yunzhuo, et al.
Publicado: (2025)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training
por: Zhang, Miaosen, et al.
Publicado: (2026)
por: Zhang, Miaosen, et al.
Publicado: (2026)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
por: Liao, Jiaqi, et al.
Publicado: (2025)
por: Liao, Jiaqi, et al.
Publicado: (2025)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
por: Yang, Zhengyuan, et al.
Publicado: (2023)
por: Yang, Zhengyuan, et al.
Publicado: (2023)
Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
por: Zhang, Miaosen, et al.
Publicado: (2026)
por: Zhang, Miaosen, et al.
Publicado: (2026)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2023)
por: Yu, Weihao, et al.
Publicado: (2023)
Language-Guided Face Animation by Recurrent StyleGAN-based Generator
por: Hang, Tiankai, et al.
Publicado: (2022)
por: Hang, Tiankai, et al.
Publicado: (2022)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
por: Guo, Heyu, et al.
Publicado: (2025)
por: Guo, Heyu, et al.
Publicado: (2025)
GREAT: Grassmannian REcursive Algorithm for Tracking & Online System Identification
por: Sasfi, András, et al.
Publicado: (2024)
por: Sasfi, András, et al.
Publicado: (2024)
DisCo: Disentangled Control for Realistic Human Dance Generation
por: Wang, Tan, et al.
Publicado: (2023)
por: Wang, Tan, et al.
Publicado: (2023)
Glance: Accelerating Diffusion Models with 1 Sample
por: Dong, Zhuobai, et al.
Publicado: (2025)
por: Dong, Zhuobai, et al.
Publicado: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
por: Zheng, Xiangxi, et al.
Publicado: (2025)
por: Zheng, Xiangxi, et al.
Publicado: (2025)
Computer-Use Agents as Judges for Generative User Interface
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation
por: Zhang, Jihai, et al.
Publicado: (2025)
por: Zhang, Jihai, et al.
Publicado: (2025)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
por: Qiu, Jielin, et al.
Publicado: (2024)
por: Qiu, Jielin, et al.
Publicado: (2024)
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
por: Mao, Dongxing, et al.
Publicado: (2026)
por: Mao, Dongxing, et al.
Publicado: (2026)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2025)
por: Wang, Xiyao, et al.
Publicado: (2025)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025)
por: Lin, Yan-Bo, et al.
Publicado: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
Optimal error bounds on time-splitting methods for the nonlinear Schrödinger equation with low regularity potential and nonlinearity
por: Bao, Weizhu, et al.
Publicado: (2023)
por: Bao, Weizhu, et al.
Publicado: (2023)
Optimal error bounds on an exponential wave integrator Fourier spectral method for the logarithmic Schrödinger equation
por: Bao, Weizhu, et al.
Publicado: (2024)
por: Bao, Weizhu, et al.
Publicado: (2024)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
por: Yan, An, et al.
Publicado: (2024)
por: Yan, An, et al.
Publicado: (2024)
GenXD: Generating Any 3D and 4D Scenes
por: Zhao, Yuyang, et al.
Publicado: (2024)
por: Zhao, Yuyang, et al.
Publicado: (2024)
Frequency Range Boosted Magnetometry Beyond the Spin Coherence Limit via Compressive Sensing
por: Wang, Ruiqi, et al.
Publicado: (2025)
por: Wang, Ruiqi, et al.
Publicado: (2025)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2024)
por: Yu, Weihao, et al.
Publicado: (2024)
Ejemplares similares
-
InfoAgent: Advancing Autonomous Information-Seeking Agents
por: Zhang, Gongrui, et al.
Publicado: (2025) -
MageBench: Bridging Large Multimodal Models to Agents
por: Zhang, Miaosen, et al.
Publicado: (2024) -
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
por: Zhang, Miaosen, et al.
Publicado: (2025) -
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
por: Wang, Alex Jinpeng, et al.
Publicado: (2025) -
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
por: Peng, Yingzhe, et al.
Publicado: (2025)