PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Shuoshuo, Li, Zijian, Zhang, Yizhen, Fu, Jingjing, Song, Lei, Bian, Jiang, Zhang, Jun, Yang, Yujiu, Wang, Rui |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
von: Zhang, Shuoshuo, et al.
Veröffentlicht: (2025)
von: Zhang, Shuoshuo, et al.
Veröffentlicht: (2025)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
von: Li, Zijian, et al.
Veröffentlicht: (2025)
von: Li, Zijian, et al.
Veröffentlicht: (2025)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
von: Li, Sijia, et al.
Veröffentlicht: (2025)
von: Li, Sijia, et al.
Veröffentlicht: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025)
Underwater Visual-Inertial-Acoustic-Depth SLAM with DVL Preintegration for Degraded Environments
von: Ding, Shuoshuo, et al.
Veröffentlicht: (2025)
von: Ding, Shuoshuo, et al.
Veröffentlicht: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
von: Ding, Yang, et al.
Veröffentlicht: (2025)
von: Ding, Yang, et al.
Veröffentlicht: (2025)
PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution
von: Li, Wenxue, et al.
Veröffentlicht: (2026)
von: Li, Wenxue, et al.
Veröffentlicht: (2026)
PIKE-RAG: sPecIalized KnowledgE and Rationale Augmented Generation
von: Wang, Jinyu, et al.
Veröffentlicht: (2025)
von: Wang, Jinyu, et al.
Veröffentlicht: (2025)
What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
von: Peng, Yuanfang, et al.
Veröffentlicht: (2026)
von: Peng, Yuanfang, et al.
Veröffentlicht: (2026)
Graph Neural Network Enhanced Retrieval for Question Answering of LLMs
von: Li, Zijian, et al.
Veröffentlicht: (2024)
von: Li, Zijian, et al.
Veröffentlicht: (2024)
Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions
von: Zhang, Xinyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Xinyuan, et al.
Veröffentlicht: (2026)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
von: Zhang, Zijian, et al.
Veröffentlicht: (2024)
von: Zhang, Zijian, et al.
Veröffentlicht: (2024)
Multi-UAV Search and Rescue in Wilderness Using Smart Agent-Based Probability Models
von: Ge, Zijian, et al.
Veröffentlicht: (2024)
von: Ge, Zijian, et al.
Veröffentlicht: (2024)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
von: Bai, Tianyi, et al.
Veröffentlicht: (2025)
von: Bai, Tianyi, et al.
Veröffentlicht: (2025)
DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation
von: Liu, Ziyuan, et al.
Veröffentlicht: (2026)
von: Liu, Ziyuan, et al.
Veröffentlicht: (2026)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
von: Yang, Wei, et al.
Veröffentlicht: (2025)
von: Yang, Wei, et al.
Veröffentlicht: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
von: Li, Yizhen, et al.
Veröffentlicht: (2025)
von: Li, Yizhen, et al.
Veröffentlicht: (2025)
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
von: Li, Sijia, et al.
Veröffentlicht: (2026)
von: Li, Sijia, et al.
Veröffentlicht: (2026)
GradCraft: Elevating Multi-task Recommendations through Holistic Gradient Crafting
von: Bai, Yimeng, et al.
Veröffentlicht: (2024)
von: Bai, Yimeng, et al.
Veröffentlicht: (2024)
ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
von: Zhang, Shuyuan, et al.
Veröffentlicht: (2025)
von: Zhang, Shuyuan, et al.
Veröffentlicht: (2025)
TacticCraft: Natural Language-Driven Tactical Adaptation for StarCraft II
von: Ma, Weiyu, et al.
Veröffentlicht: (2025)
von: Ma, Weiyu, et al.
Veröffentlicht: (2025)
FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion
von: Ma, Lichen, et al.
Veröffentlicht: (2026)
von: Ma, Lichen, et al.
Veröffentlicht: (2026)
Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning
von: Zhang, Sixian, et al.
Veröffentlicht: (2026)
von: Zhang, Sixian, et al.
Veröffentlicht: (2026)
UltraPixel: Advancing Ultra-High-Resolution Image Synthesis to New Peaks
von: Ren, Jingjing, et al.
Veröffentlicht: (2024)
von: Ren, Jingjing, et al.
Veröffentlicht: (2024)
HLSMAC: A New StarCraft Multi-Agent Challenge for High-Level Strategic Decision-Making
von: Hong, Xingxing, et al.
Veröffentlicht: (2025)
von: Hong, Xingxing, et al.
Veröffentlicht: (2025)
Closing Reasoning Gaps in Clinical Agents with Differential Reasoning Learning
von: Liu, Jinsong, et al.
Veröffentlicht: (2026)
von: Liu, Jinsong, et al.
Veröffentlicht: (2026)
Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
von: Bian, Haoyu, et al.
Veröffentlicht: (2026)
von: Bian, Haoyu, et al.
Veröffentlicht: (2026)
StarCraftImage: A Dataset For Prototyping Spatial Reasoning Methods For Multi-Agent Environments
von: Kulinski, Sean, et al.
Veröffentlicht: (2024)
von: Kulinski, Sean, et al.
Veröffentlicht: (2024)
Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling
von: Ye, Ruijie, et al.
Veröffentlicht: (2026)
von: Ye, Ruijie, et al.
Veröffentlicht: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
von: Jiang, Jingjing, et al.
Veröffentlicht: (2025)
von: Jiang, Jingjing, et al.
Veröffentlicht: (2025)
Structure-to-Image: Zero-Shot Depth Estimation in Colonoscopy via High-Fidelity Sim-to-Real Adaptation
von: Yang, Juan, et al.
Veröffentlicht: (2026)
von: Yang, Juan, et al.
Veröffentlicht: (2026)
Reasoning about Strategic Abilities in Stochastic Multi-agent Systems
von: Zhang, Yedi, et al.
Veröffentlicht: (2024)
von: Zhang, Yedi, et al.
Veröffentlicht: (2024)
AVA: Attentive VLM Agent for Mastering StarCraft II
von: Ma, Weiyu, et al.
Veröffentlicht: (2025)
von: Ma, Weiyu, et al.
Veröffentlicht: (2025)
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2025)
von: Zhao, Xiangyu, et al.
Veröffentlicht: (2025)
MAPS: Multi-Agent Personality Shaping for Collaborative Reasoning
von: Zhang, Jian, et al.
Veröffentlicht: (2025)
von: Zhang, Jian, et al.
Veröffentlicht: (2025)
PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization
von: Zhang, Jiajun, et al.
Veröffentlicht: (2025)
von: Zhang, Jiajun, et al.
Veröffentlicht: (2025)
LLM-FK: Multi-Agent LLM Reasoning for Foreign Key Detection in Large-Scale Complex Databases
von: Tang, Zijian, et al.
Veröffentlicht: (2026)
von: Tang, Zijian, et al.
Veröffentlicht: (2026)
MedFeat: Model-Aware and Explainability-Driven Feature Engineering with LLMs for Clinical Tabular Prediction
von: Zhang, Zizheng, et al.
Veröffentlicht: (2026)
von: Zhang, Zizheng, et al.
Veröffentlicht: (2026)
HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion
von: He, Yu, et al.
Veröffentlicht: (2026)
von: He, Yu, et al.
Veröffentlicht: (2026)
MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls
von: Bian, Yuxuan, et al.
Veröffentlicht: (2024)
von: Bian, Yuxuan, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
von: Zhang, Shuoshuo, et al.
Veröffentlicht: (2025) -
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
von: Li, Zijian, et al.
Veröffentlicht: (2025) -
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
von: Li, Sijia, et al.
Veröffentlicht: (2025) -
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
von: Zhang, Yizhen, et al.
Veröffentlicht: (2025) -
Underwater Visual-Inertial-Acoustic-Depth SLAM with DVL Preintegration for Degraded Environments
von: Ding, Shuoshuo, et al.
Veröffentlicht: (2025)