OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Bowen, Jin, Kaiming, Wu, Zhenyu, Liu, Zhaoyang, Sun, Qiushi, Li, Zehao, Xie, JingJing, Liu, Zhoumianze, Xu, Fangzhi, Cheng, Kanzhi, Li, Qingyun, Wang, Yian, Qiao, Yu, Wang, Zun, Ding, Zichen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
di: Wu, Zhiyong, et al.
Pubblicazione: (2024)
di: Wu, Zhiyong, et al.
Pubblicazione: (2024)
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
di: Sun, Qiushi, et al.
Pubblicazione: (2024)
di: Sun, Qiushi, et al.
Pubblicazione: (2024)
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards
di: Li, Zehao, et al.
Pubblicazione: (2026)
di: Li, Zehao, et al.
Pubblicazione: (2026)
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)
Interactive Evolution: A Neural-Symbolic Self-Training Framework For Large Language Models
di: Xu, Fangzhi, et al.
Pubblicazione: (2024)
di: Xu, Fangzhi, et al.
Pubblicazione: (2024)
ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
di: Sun, Qiushi, et al.
Pubblicazione: (2025)
U-Net-Like Spiking Neural Networks for Single Image Dehazing
di: Li, Huibin, et al.
Pubblicazione: (2025)
di: Li, Huibin, et al.
Pubblicazione: (2025)
SITransformer: Shared Information-Guided Transformer for Extreme Multimodal Summarization
di: Liu, Sicheng, et al.
Pubblicazione: (2024)
di: Liu, Sicheng, et al.
Pubblicazione: (2024)
Generalist versus Specialist Vision Foundation Models for Ocular Disease and Oculomics
di: Zhou, Yukun, et al.
Pubblicazione: (2025)
di: Zhou, Yukun, et al.
Pubblicazione: (2025)
Bias Begets Bias: The Impact of Biased Embeddings on Diffusion Models
di: Kuchlous, Sahil, et al.
Pubblicazione: (2024)
di: Kuchlous, Sahil, et al.
Pubblicazione: (2024)
FocusedAD: Character-centric Movie Audio Description
di: Ye, Xiaojun, et al.
Pubblicazione: (2025)
di: Ye, Xiaojun, et al.
Pubblicazione: (2025)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
di: Feng, Yigui, et al.
Pubblicazione: (2026)
di: Feng, Yigui, et al.
Pubblicazione: (2026)
OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
di: Cheng, Kanzhi, et al.
Pubblicazione: (2026)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2026)
Look, Listen, and Answer: Overcoming Biases for Audio-Visual Question Answering
di: Ma, Jie, et al.
Pubblicazione: (2024)
di: Ma, Jie, et al.
Pubblicazione: (2024)
SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
Multi-modal Sensor Fusion for Auto Driving Perception: A Survey
di: Huang, Keli, et al.
Pubblicazione: (2022)
di: Huang, Keli, et al.
Pubblicazione: (2022)
DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding
di: Han, Yudong, et al.
Pubblicazione: (2024)
di: Han, Yudong, et al.
Pubblicazione: (2024)
4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding
di: Chen, Zhangquan, et al.
Pubblicazione: (2026)
di: Chen, Zhangquan, et al.
Pubblicazione: (2026)
Hierarchical Feature-level Reverse Propagation for Post-Training Neural Networks
di: Ding, Ni, et al.
Pubblicazione: (2025)
di: Ding, Ni, et al.
Pubblicazione: (2025)
GarmageNet: A Multimodal Generative Framework for Sewing Pattern Design and Generic Garment Modeling
di: Li, Siran, et al.
Pubblicazione: (2025)
di: Li, Siran, et al.
Pubblicazione: (2025)
Textual and Visual Guided Task Adaptation for Source-Free Cross-Domain Few-Shot Segmentation
di: Liu, Jianming, et al.
Pubblicazione: (2025)
di: Liu, Jianming, et al.
Pubblicazione: (2025)
OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention
di: Chen, Zhangquan, et al.
Pubblicazione: (2026)
di: Chen, Zhangquan, et al.
Pubblicazione: (2026)
Video-CoE: Reinforcing Video Event Prediction via Chain of Events
di: Su, Qile, et al.
Pubblicazione: (2026)
di: Su, Qile, et al.
Pubblicazione: (2026)
Vision-Language Models Can Self-Improve Reasoning via Reflection
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
di: Cheng, Kanzhi, et al.
Pubblicazione: (2024)
A Comparative Analysis of Recurrent and Attention Architectures for Isolated Sign Language Recognition
di: Alishzade, Nigar, et al.
Pubblicazione: (2025)
di: Alishzade, Nigar, et al.
Pubblicazione: (2025)
FoR-Net: Learning to Focus on Hard Regions for Efficient Semantic Segmentation
di: Chan, Sheng-Wei, et al.
Pubblicazione: (2026)
di: Chan, Sheng-Wei, et al.
Pubblicazione: (2026)
SemanticHuman-HD: High-Resolution Semantic Disentangled 3D Human Generation
di: Zheng, Peng, et al.
Pubblicazione: (2024)
di: Zheng, Peng, et al.
Pubblicazione: (2024)
VisRL: Intention-Driven Visual Perception via Reinforced Reasoning
di: Chen, Zhangquan, et al.
Pubblicazione: (2025)
di: Chen, Zhangquan, et al.
Pubblicazione: (2025)
MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction
di: Wang, Chao, et al.
Pubblicazione: (2025)
di: Wang, Chao, et al.
Pubblicazione: (2025)
One Leaf Reveals the Season: Occlusion-Based Contrastive Learning with Semantic-Aware Views for Efficient Visual Representation
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Yang, Xiaoyu, et al.
Pubblicazione: (2024)
Robust Visual Question Answering: Datasets, Methods, and Future Challenges
di: Ma, Jie, et al.
Pubblicazione: (2023)
di: Ma, Jie, et al.
Pubblicazione: (2023)
LEGO: LoRA-Enabled Generator-Oriented Framework for Synthetic Image Detection
di: Xiao, Yutong, et al.
Pubblicazione: (2026)
di: Xiao, Yutong, et al.
Pubblicazione: (2026)
ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment
di: Bian, Zhipeng, et al.
Pubblicazione: (2026)
di: Bian, Zhipeng, et al.
Pubblicazione: (2026)
NumeriKontrol: Adding Numeric Control to Diffusion Transformers for Instruction-based Image Editing
di: Xu, Zhenyu, et al.
Pubblicazione: (2025)
di: Xu, Zhenyu, et al.
Pubblicazione: (2025)
Visual Enhanced Depth Scaling for Multimodal Latent Reasoning
di: Han, Yudong, et al.
Pubblicazione: (2026)
di: Han, Yudong, et al.
Pubblicazione: (2026)
A Reverse Causal Framework to Mitigate Spurious Correlations for Debiasing Scene Graph Generation
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
A Challenging Benchmark of Anime Style Recognition
di: Li, Haotang, et al.
Pubblicazione: (2022)
di: Li, Haotang, et al.
Pubblicazione: (2022)
3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding
di: Chen, Yiping, et al.
Pubblicazione: (2026)
di: Chen, Yiping, et al.
Pubblicazione: (2026)
OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
di: Wang, Chaoyi, et al.
Pubblicazione: (2025)
di: Wang, Chaoyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
OS-ATLAS: A Foundation Action Model for Generalist GUI Agents
di: Wu, Zhiyong, et al.
Pubblicazione: (2024) -
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
di: Sun, Qiushi, et al.
Pubblicazione: (2024) -
OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows
di: Sun, Qiushi, et al.
Pubblicazione: (2025) -
OS-Themis: A Scalable Critic Framework for Generalist GUI Rewards
di: Li, Zehao, et al.
Pubblicazione: (2026) -
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models
di: Wu, Zhenyu, et al.
Pubblicazione: (2025)