PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Shuoshuo, Li, Zijian, Zhang, Yizhen, Fu, Jingjing, Song, Lei, Bian, Jiang, Zhang, Jun, Yang, Yujiu, Wang, Rui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
par: Zhang, Shuoshuo, et autres
Publié: (2025)
par: Zhang, Shuoshuo, et autres
Publié: (2025)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
par: Li, Zijian, et autres
Publié: (2025)
par: Li, Zijian, et autres
Publié: (2025)
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
par: Li, Sijia, et autres
Publié: (2025)
par: Li, Sijia, et autres
Publié: (2025)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025)
par: Zhang, Yizhen, et autres
Publié: (2025)
Underwater Visual-Inertial-Acoustic-Depth SLAM with DVL Preintegration for Degraded Environments
par: Ding, Shuoshuo, et autres
Publié: (2025)
par: Ding, Shuoshuo, et autres
Publié: (2025)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
par: Ding, Yang, et autres
Publié: (2025)
par: Ding, Yang, et autres
Publié: (2025)
PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution
par: Li, Wenxue, et autres
Publié: (2026)
par: Li, Wenxue, et autres
Publié: (2026)
PIKE-RAG: sPecIalized KnowledgE and Rationale Augmented Generation
par: Wang, Jinyu, et autres
Publié: (2025)
par: Wang, Jinyu, et autres
Publié: (2025)
What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
par: Peng, Yuanfang, et autres
Publié: (2026)
par: Peng, Yuanfang, et autres
Publié: (2026)
Graph Neural Network Enhanced Retrieval for Question Answering of LLMs
par: Li, Zijian, et autres
Publié: (2024)
par: Li, Zijian, et autres
Publié: (2024)
Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions
par: Zhang, Xinyuan, et autres
Publié: (2026)
par: Zhang, Xinyuan, et autres
Publié: (2026)
Integrating Text and Image Pre-training for Multi-modal Algorithmic Reasoning
par: Zhang, Zijian, et autres
Publié: (2024)
par: Zhang, Zijian, et autres
Publié: (2024)
Multi-UAV Search and Rescue in Wilderness Using Smart Agent-Based Probability Models
par: Ge, Zijian, et autres
Publié: (2024)
par: Ge, Zijian, et autres
Publié: (2024)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
DesignAsCode: Bridging Structural Editability and Visual Fidelity in Graphic Design Generation
par: Liu, Ziyuan, et autres
Publié: (2026)
par: Liu, Ziyuan, et autres
Publié: (2026)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
par: Yang, Wei, et autres
Publié: (2025)
par: Yang, Wei, et autres
Publié: (2025)
Decoupling the Image Perception and Multimodal Reasoning for Reasoning Segmentation with Digital Twin Representations
par: Li, Yizhen, et autres
Publié: (2025)
par: Li, Yizhen, et autres
Publié: (2025)
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
par: Li, Sijia, et autres
Publié: (2026)
par: Li, Sijia, et autres
Publié: (2026)
GradCraft: Elevating Multi-task Recommendations through Holistic Gradient Crafting
par: Bai, Yimeng, et autres
Publié: (2024)
par: Bai, Yimeng, et autres
Publié: (2024)
ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
par: Zhang, Shuyuan, et autres
Publié: (2025)
par: Zhang, Shuyuan, et autres
Publié: (2025)
TacticCraft: Natural Language-Driven Tactical Adaptation for StarCraft II
par: Ma, Weiyu, et autres
Publié: (2025)
par: Ma, Weiyu, et autres
Publié: (2025)
FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion
par: Ma, Lichen, et autres
Publié: (2026)
par: Ma, Lichen, et autres
Publié: (2026)
Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning
par: Zhang, Sixian, et autres
Publié: (2026)
par: Zhang, Sixian, et autres
Publié: (2026)
UltraPixel: Advancing Ultra-High-Resolution Image Synthesis to New Peaks
par: Ren, Jingjing, et autres
Publié: (2024)
par: Ren, Jingjing, et autres
Publié: (2024)
HLSMAC: A New StarCraft Multi-Agent Challenge for High-Level Strategic Decision-Making
par: Hong, Xingxing, et autres
Publié: (2025)
par: Hong, Xingxing, et autres
Publié: (2025)
Closing Reasoning Gaps in Clinical Agents with Differential Reasoning Learning
par: Liu, Jinsong, et autres
Publié: (2026)
par: Liu, Jinsong, et autres
Publié: (2026)
Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
par: Bian, Haoyu, et autres
Publié: (2026)
par: Bian, Haoyu, et autres
Publié: (2026)
StarCraftImage: A Dataset For Prototyping Spatial Reasoning Methods For Multi-Agent Environments
par: Kulinski, Sean, et autres
Publié: (2024)
par: Kulinski, Sean, et autres
Publié: (2024)
Agent Banana: High-Fidelity Image Editing with Agentic Thinking and Tooling
par: Ye, Ruijie, et autres
Publié: (2026)
par: Ye, Ruijie, et autres
Publié: (2026)
Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Structure-to-Image: Zero-Shot Depth Estimation in Colonoscopy via High-Fidelity Sim-to-Real Adaptation
par: Yang, Juan, et autres
Publié: (2026)
par: Yang, Juan, et autres
Publié: (2026)
Reasoning about Strategic Abilities in Stochastic Multi-agent Systems
par: Zhang, Yedi, et autres
Publié: (2024)
par: Zhang, Yedi, et autres
Publié: (2024)
AVA: Attentive VLM Agent for Mastering StarCraft II
par: Ma, Weiyu, et autres
Publié: (2025)
par: Ma, Weiyu, et autres
Publié: (2025)
Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
MAPS: Multi-Agent Personality Shaping for Collaborative Reasoning
par: Zhang, Jian, et autres
Publié: (2025)
par: Zhang, Jian, et autres
Publié: (2025)
PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization
par: Zhang, Jiajun, et autres
Publié: (2025)
par: Zhang, Jiajun, et autres
Publié: (2025)
LLM-FK: Multi-Agent LLM Reasoning for Foreign Key Detection in Large-Scale Complex Databases
par: Tang, Zijian, et autres
Publié: (2026)
par: Tang, Zijian, et autres
Publié: (2026)
MedFeat: Model-Aware and Explainability-Driven Feature Engineering with LLMs for Clinical Tabular Prediction
par: Zhang, Zizheng, et autres
Publié: (2026)
par: Zhang, Zizheng, et autres
Publié: (2026)
HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion
par: He, Yu, et autres
Publié: (2026)
par: He, Yu, et autres
Publié: (2026)
MotionCraft: Crafting Whole-Body Motion with Plug-and-Play Multimodal Controls
par: Bian, Yuxuan, et autres
Publié: (2024)
par: Bian, Yuxuan, et autres
Publié: (2024)
Documents similaires
-
See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning
par: Zhang, Shuoshuo, et autres
Publié: (2025) -
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
par: Li, Zijian, et autres
Publié: (2025) -
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
par: Li, Sijia, et autres
Publié: (2025) -
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
par: Zhang, Yizhen, et autres
Publié: (2025) -
Underwater Visual-Inertial-Acoustic-Depth SLAM with DVL Preintegration for Degraded Environments
par: Ding, Shuoshuo, et autres
Publié: (2025)