RAGNet: Large-scale Reasoning-based Affordance Segmentation Benchmark towards General Grasping
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Dongming, Fu, Yanping, Huang, Saike, Liu, Yingfei, Jia, Fan, Liu, Nian, Dai, Feng, Wang, Tiancai, Anwer, Rao Muhammad, Khan, Fahad Shahbaz, Shen, Jianbing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DB-SAM: Delving into High Quality Universal Medical Image Segmentation
par: Qin, Chao, et autres
Publié: (2024)
par: Qin, Chao, et autres
Publié: (2024)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025)
par: Luo, Ziyang, et autres
Publié: (2025)
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
par: Boudjoghra, Mohamed El Amine, et autres
Publié: (2024)
par: Boudjoghra, Mohamed El Amine, et autres
Publié: (2024)
AffordanceGrasp-R1:Leveraging Reasoning-Based Affordance Segmentation with Reinforcement Learning for Robotic Grasping
par: Zhou, Dingyi, et autres
Publié: (2026)
par: Zhou, Dingyi, et autres
Publié: (2026)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
par: Ishaq, Ayesha, et autres
Publié: (2025)
par: Ishaq, Ayesha, et autres
Publié: (2025)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
par: Hanif, Asif, et autres
Publié: (2024)
par: Hanif, Asif, et autres
Publié: (2024)
Language Prompt for Autonomous Driving
par: Wu, Dongming, et autres
Publié: (2023)
par: Wu, Dongming, et autres
Publié: (2023)
MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning
par: Ashraf, Tajamul, et autres
Publié: (2025)
par: Ashraf, Tajamul, et autres
Publié: (2025)
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
par: Nawaz, Umair, et autres
Publié: (2025)
par: Nawaz, Umair, et autres
Publié: (2025)
CONDA: Condensed Deep Association Learning for Co-Salient Object Detection
par: Li, Long, et autres
Publié: (2024)
par: Li, Long, et autres
Publié: (2024)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
par: Sheikh, Tooba Tehreem, et autres
Publié: (2025)
Semi-supervised Open-World Object Detection
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)
par: Mullappilly, Sahal Shaji, et autres
Publié: (2024)
Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
par: Ghaboura, Sara, et autres
Publié: (2025)
par: Ghaboura, Sara, et autres
Publié: (2025)
Composed Video Retrieval via Enriched Context and Discriminative Embeddings
par: Thawakar, Omkar, et autres
Publié: (2024)
par: Thawakar, Omkar, et autres
Publié: (2024)
AIN: The Arabic INclusive Large Multimodal Model
par: Heakl, Ahmed, et autres
Publié: (2025)
par: Heakl, Ahmed, et autres
Publié: (2025)
Beyond Simple Edits: Composed Video Retrieval with Dense Modifications
par: Thawakar, Omkar, et autres
Publié: (2025)
par: Thawakar, Omkar, et autres
Publié: (2025)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
par: Noman, Mubashir, et autres
Publié: (2024)
par: Noman, Mubashir, et autres
Publié: (2024)
Video-R2: Reinforcing Consistent and Grounded Reasoning in Multimodal Language Models
par: Maaz, Muhammad, et autres
Publié: (2025)
par: Maaz, Muhammad, et autres
Publié: (2025)
BiMediX: Bilingual Medical Mixture of Experts LLM
par: Pieri, Sara, et autres
Publié: (2024)
par: Pieri, Sara, et autres
Publié: (2024)
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
par: Zhang, Yani, et autres
Publié: (2025)
par: Zhang, Yani, et autres
Publié: (2025)
Modulate Your Spectrum in Self-Supervised Learning
par: Weng, Xi, et autres
Publié: (2023)
par: Weng, Xi, et autres
Publié: (2023)
Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
par: Ishaq, Ayesha, et autres
Publié: (2024)
par: Ishaq, Ayesha, et autres
Publié: (2024)
TerraFM: A Scalable Foundation Model for Unified Multisensor Earth Observation
par: Danish, Muhammad Sohail, et autres
Publié: (2025)
par: Danish, Muhammad Sohail, et autres
Publié: (2025)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
par: Kumar, Komal, et autres
Publié: (2025)
par: Kumar, Komal, et autres
Publié: (2025)
Adapting In-Domain Few-Shot Segmentation to New Domains without Source Domain Retraining
par: Fan, Qi, et autres
Publié: (2025)
par: Fan, Qi, et autres
Publié: (2025)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
par: Thawakar, Omkar, et autres
Publié: (2023)
par: Thawakar, Omkar, et autres
Publié: (2023)
Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?
par: Bai, Yifan, et autres
Publié: (2024)
par: Bai, Yifan, et autres
Publié: (2024)
VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos
par: Rasheed, Hanoona, et autres
Publié: (2025)
par: Rasheed, Hanoona, et autres
Publié: (2025)
A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos
par: Kurpath, Mohammed Irfan, et autres
Publié: (2025)
par: Kurpath, Mohammed Irfan, et autres
Publié: (2025)
GAT-Grasp: Gesture-Driven Affordance Transfer for Task-Aware Robotic Grasping
par: Wang, Ruixiang, et autres
Publié: (2025)
par: Wang, Ruixiang, et autres
Publié: (2025)
Language Guided Domain Generalized Medical Image Segmentation
par: Kunhimon, Shahina, et autres
Publié: (2024)
par: Kunhimon, Shahina, et autres
Publié: (2024)
Efficient Localized Adaptation of Neural Weather Forecasting: A Case Study in the MENA Region
par: Munir, Muhammad Akhtar, et autres
Publié: (2024)
par: Munir, Muhammad Akhtar, et autres
Publié: (2024)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
par: Nawaz, Umair, et autres
Publié: (2024)
par: Nawaz, Umair, et autres
Publié: (2024)
ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark
par: Ghaboura, Sara, et autres
Publié: (2025)
par: Ghaboura, Sara, et autres
Publié: (2025)
Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
par: Maaz, Muhammad, et autres
Publié: (2023)
par: Maaz, Muhammad, et autres
Publié: (2023)
How Good are Foundation Models in Step-by-Step Embodied Reasoning?
par: Dissanayake, Dinura, et autres
Publié: (2025)
par: Dissanayake, Dinura, et autres
Publié: (2025)
UNETR++: Delving into Efficient and Accurate 3D Medical Image Segmentation
par: Shaker, Abdelrahman, et autres
Publié: (2022)
par: Shaker, Abdelrahman, et autres
Publié: (2022)
GenZSL: Generative Zero-Shot Learning Via Inductive Variational Autoencoder
par: Chen, Shiming, et autres
Publié: (2025)
par: Chen, Shiming, et autres
Publié: (2025)
Documents similaires
-
DB-SAM: Delving into High Quality Universal Medical Image Segmentation
par: Qin, Chao, et autres
Publié: (2024) -
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
par: Luo, Ziyang, et autres
Publié: (2025) -
AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation
par: Luo, Ziyang, et autres
Publié: (2025) -
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
par: Boudjoghra, Mohamed El Amine, et autres
Publié: (2024) -
AffordanceGrasp-R1:Leveraging Reasoning-Based Affordance Segmentation with Reinforcement Learning for Robotic Grasping
par: Zhou, Dingyi, et autres
Publié: (2026)