FaSTA$^*$: Fast-Slow Toolpath Agent with Subroutine Mining for Efficient Multi-turn Image Editing
Fuente:
arXiv
Guardado en:
| Autores principales: | Gupta, Advait, Raj, Rishie, Nguyen, Dang, Zhou, Tianyi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoSTA$\ast$: Cost-Sensitive Toolpath Agent for Multi-turn Image Editing
por: Gupta, Advait, et al.
Publicado: (2025)
por: Gupta, Advait, et al.
Publicado: (2025)
Multi-turn Consistent Image Editing
por: Zhou, Zijun, et al.
Publicado: (2025)
por: Zhou, Zijun, et al.
Publicado: (2025)
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2025)
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2025)
CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator
por: Pu, Yuhan, et al.
Publicado: (2026)
por: Pu, Yuhan, et al.
Publicado: (2026)
SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging
por: Zeng, Haijin, et al.
Publicado: (2025)
por: Zeng, Haijin, et al.
Publicado: (2025)
FaR: Enhancing Multi-Concept Text-to-Image Diffusion via Concept Fusion and Localized Refinement
por: Tran, Gia-Nghia, et al.
Publicado: (2025)
por: Tran, Gia-Nghia, et al.
Publicado: (2025)
SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
Talk2Image: A Multi-Agent System for Multi-Turn Image Generation and Editing
por: Ma, Shichao, et al.
Publicado: (2025)
por: Ma, Shichao, et al.
Publicado: (2025)
Predicting the Reliability of an Image Classifier under Image Distortion
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting
por: Pieta, Pawel Tomasz, et al.
Publicado: (2026)
por: Pieta, Pawel Tomasz, et al.
Publicado: (2026)
ChartAB: A Benchmark for Chart Grounding & Dense Alignment
por: Bansal, Aniruddh, et al.
Publicado: (2025)
por: Bansal, Aniruddh, et al.
Publicado: (2025)
Few-shot Algorithm Assurance
por: Nguyen, Dang, et al.
Publicado: (2024)
por: Nguyen, Dang, et al.
Publicado: (2024)
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
por: Dong, Sibo, et al.
Publicado: (2025)
por: Dong, Sibo, et al.
Publicado: (2025)
M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
por: Lv, Rui, et al.
Publicado: (2026)
por: Lv, Rui, et al.
Publicado: (2026)
iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception
por: Mehrotra, Sarthak, et al.
Publicado: (2025)
por: Mehrotra, Sarthak, et al.
Publicado: (2025)
ParallelEdits: Efficient Multi-object Image Editing
por: Huang, Mingzhen, et al.
Publicado: (2024)
por: Huang, Mingzhen, et al.
Publicado: (2024)
ActivityCLIP: Enhancing Group Activity Recognition by Mining Complementary Information from Text to Supplement Image Modality
por: Xu, Guoliang, et al.
Publicado: (2024)
por: Xu, Guoliang, et al.
Publicado: (2024)
Learning to Think Fast and Slow for Visual Language Models
por: Lin, Chenyu, et al.
Publicado: (2025)
por: Lin, Chenyu, et al.
Publicado: (2025)
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation
por: Schusterbauer, Johannes, et al.
Publicado: (2026)
por: Schusterbauer, Johannes, et al.
Publicado: (2026)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
por: Shi, Min, et al.
Publicado: (2025)
por: Shi, Min, et al.
Publicado: (2025)
FreeFlux: Understanding and Exploiting Layer-Specific Roles in RoPE-Based MMDiT for Versatile Image Editing
por: Wei, Tianyi, et al.
Publicado: (2025)
por: Wei, Tianyi, et al.
Publicado: (2025)
FaSS-MVS -- Fast Multi-View Stereo with Surface-Aware Semi-Global Matching from UAV-borne Monocular Imagery
por: Ruf, Boitumelo, et al.
Publicado: (2021)
por: Ruf, Boitumelo, et al.
Publicado: (2021)
Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
por: Yang, Wenhao, et al.
Publicado: (2025)
por: Yang, Wenhao, et al.
Publicado: (2025)
Lightning-Fast Image Inversion and Editing for Text-to-Image Diffusion Models
por: Samuel, Dvir, et al.
Publicado: (2023)
por: Samuel, Dvir, et al.
Publicado: (2023)
CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
por: Venkatesh, Kavana, et al.
Publicado: (2025)
por: Venkatesh, Kavana, et al.
Publicado: (2025)
PhysMamba: Efficient Remote Physiological Measurement with SlowFast Temporal Difference Mamba
por: Luo, Chaoqi, et al.
Publicado: (2024)
por: Luo, Chaoqi, et al.
Publicado: (2024)
MultiLoc: Multi-view Guided Relative Pose Regression for Fast and Robust Visual Re-Localization
por: Dang, Nobel, et al.
Publicado: (2026)
por: Dang, Nobel, et al.
Publicado: (2026)
CCA: Collaborative Competitive Agents for Image Editing
por: Hang, Tiankai, et al.
Publicado: (2024)
por: Hang, Tiankai, et al.
Publicado: (2024)
Interactive Continual Learning: Fast and Slow Thinking
por: Qi, Biqing, et al.
Publicado: (2024)
por: Qi, Biqing, et al.
Publicado: (2024)
FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO
por: Zhao, Fufangchen, et al.
Publicado: (2025)
por: Zhao, Fufangchen, et al.
Publicado: (2025)
AutoStudio: Crafting Consistent Subjects in Multi-turn Interactive Image Generation
por: Cheng, Junhao, et al.
Publicado: (2024)
por: Cheng, Junhao, et al.
Publicado: (2024)
TheaterGen: Character Management with LLM for Consistent Multi-turn Image Generation
por: Cheng, Junhao, et al.
Publicado: (2024)
por: Cheng, Junhao, et al.
Publicado: (2024)
Flow-CDNet: A Novel Network for Detecting Both Slow and Fast Changes in Bitemporal Images
por: Li, Haoxuan, et al.
Publicado: (2025)
por: Li, Haoxuan, et al.
Publicado: (2025)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening
por: Nahin, Shahriar Kabir, et al.
Publicado: (2026)
por: Nahin, Shahriar Kabir, et al.
Publicado: (2026)
MedSAM-Agent: Empowering Interactive Medical Image Segmentation with Multi-turn Agentic Reinforcement Learning
por: Liu, Shengyuan, et al.
Publicado: (2026)
por: Liu, Shengyuan, et al.
Publicado: (2026)
FireFlow: Fast Inversion of Rectified Flow for Image Semantic Editing
por: Deng, Yingying, et al.
Publicado: (2024)
por: Deng, Yingying, et al.
Publicado: (2024)
Inverse-and-Edit: Effective and Fast Image Editing by Cycle Consistency Models
por: Beletskii, Ilia, et al.
Publicado: (2025)
por: Beletskii, Ilia, et al.
Publicado: (2025)
RegionDrag: Fast Region-Based Image Editing with Diffusion Models
por: Lu, Jingyi, et al.
Publicado: (2024)
por: Lu, Jingyi, et al.
Publicado: (2024)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
por: Zeng, Ziyun, et al.
Publicado: (2025)
por: Zeng, Ziyun, et al.
Publicado: (2025)
Ejemplares similares
-
CoSTA$\ast$: Cost-Sensitive Toolpath Agent for Multi-turn Image Editing
por: Gupta, Advait, et al.
Publicado: (2025) -
Multi-turn Consistent Image Editing
por: Zhou, Zijun, et al.
Publicado: (2025) -
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2025) -
CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator
por: Pu, Yuhan, et al.
Publicado: (2026) -
SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging
por: Zeng, Haijin, et al.
Publicado: (2025)