A Neurosymbolic Agent System for Compositional Visual Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Yichang, Liu, Gaowen, Kompella, Ramana Rao, Hu, Sihao, Ilhan, Fatih, Tekin, Selim Furkan, Yahn, Zachary, Liu, Ling |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
di: Xu, Yichang, et al.
Pubblicazione: (2026)
di: Xu, Yichang, et al.
Pubblicazione: (2026)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
di: Ilhan, Fatih, et al.
Pubblicazione: (2026)
di: Ilhan, Fatih, et al.
Pubblicazione: (2026)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
A Survey on Large Language Model-Based Game Agents
di: Hu, Sihao, et al.
Pubblicazione: (2024)
di: Hu, Sihao, et al.
Pubblicazione: (2024)
Adversarial Attention Perturbations for Large Object Detection Transformers
di: Yahn, Zachary, et al.
Pubblicazione: (2025)
di: Yahn, Zachary, et al.
Pubblicazione: (2025)
Personalized Face Privacy Protection From a Single Image
di: Yahn, Zachary, et al.
Pubblicazione: (2026)
di: Yahn, Zachary, et al.
Pubblicazione: (2026)
Dynamic Optimizations of LLM Ensembles with Two-Stage Reinforcement Learning Agents
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2025)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2025)
Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
H3Fusion: Helpful, Harmless, Honest Fusion of Aligned LLMs
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Robust Few-Shot Ensemble Learning with Focal Diversity-Based Pruning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Efficient Multitask Dense Predictor via Binarization
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
Targeted Forgetting of Image Subgroups in CLIP Models
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
MELT: A Behavioral Trace Dataset for High-Risk Memecoin Launch Detection
di: Hu, Sihao, et al.
Pubblicazione: (2026)
di: Hu, Sihao, et al.
Pubblicazione: (2026)
Lisa: Lazy Safety Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
Virus: Harmful Fine-tuning Attack for Large Language Models Bypassing Guardrail Moderation
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
di: Huang, Tiansheng, et al.
Pubblicazione: (2025)
Booster: Tackling Harmful Fine-tuning for Large Language Models via Attenuating Harmful Perturbation
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
LLM-TOPLA: Efficient LLM Ensemble by Maximising Diversity
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2024)
Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
di: Ilhan, Fatih, et al.
Pubblicazione: (2025)
di: Ilhan, Fatih, et al.
Pubblicazione: (2025)
Orientation-anchored Hyper-Gaussian for 4D Reconstruction from Casual Videos
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
Urban Scene Diffusion through Semantic Occupancy Map
di: Zhang, Junge, et al.
Pubblicazione: (2024)
di: Zhang, Junge, et al.
Pubblicazione: (2024)
Motion Marionette: Rethinking Rigid Motion Transfer via Prior Guidance
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
SwiftNDC: Fast Neural Depth Correction for High-Fidelity 3D Reconstruction
di: Han, Kang, et al.
Pubblicazione: (2026)
di: Han, Kang, et al.
Pubblicazione: (2026)
GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
Training-Free Semantic Segmentation via LLM-Supervision
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
Prompt Diffusion Robustifies Any-Modality Prompt Learning
di: Du, Yingjun, et al.
Pubblicazione: (2024)
di: Du, Yingjun, et al.
Pubblicazione: (2024)
Spectrally Distilled Representations Aligned with Instruction-Augmented LLMs for Satellite Imagery
di: Do, Minh Kha, et al.
Pubblicazione: (2026)
di: Do, Minh Kha, et al.
Pubblicazione: (2026)
UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models
di: Zhang, Yihua, et al.
Pubblicazione: (2024)
di: Zhang, Yihua, et al.
Pubblicazione: (2024)
Large Language Model based Smart Contract Auditing with LLMBugScanner
di: Yuan, Yining, et al.
Pubblicazione: (2025)
di: Yuan, Yining, et al.
Pubblicazione: (2025)
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization
di: Wang, Yikun, et al.
Pubblicazione: (2025)
di: Wang, Yikun, et al.
Pubblicazione: (2025)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
LightPure: Realtime Adversarial Image Purification for Mobile Devices Using Diffusion Models
di: Khalili, Hossein, et al.
Pubblicazione: (2024)
di: Khalili, Hossein, et al.
Pubblicazione: (2024)
Personalized Privacy Protection Mask Against Unauthorized Facial Recognition
di: Chow, Ka-Ho, et al.
Pubblicazione: (2024)
di: Chow, Ka-Ho, et al.
Pubblicazione: (2024)
Autonomous Imagination: Closed-Loop Decomposition of Visual-to-Textual Conversion in Visual Reasoning for Multimodal Large Language Models
di: Liu, Jingming, et al.
Pubblicazione: (2024)
di: Liu, Jingming, et al.
Pubblicazione: (2024)
Compositional Caching for Training-free Open-vocabulary Attribute Detection
di: Garosi, Marco, et al.
Pubblicazione: (2025)
di: Garosi, Marco, et al.
Pubblicazione: (2025)
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
di: Fan, Chongyu, et al.
Pubblicazione: (2026)
di: Fan, Chongyu, et al.
Pubblicazione: (2026)
Self-Adapting Large Visual-Language Models to Edge Devices across Visual Modalities
di: Cai, Kaiwen, et al.
Pubblicazione: (2024)
di: Cai, Kaiwen, et al.
Pubblicazione: (2024)
Investigating Traffic Accident Detection Using Multimodal Large Language Models
di: Skender, Ilhan, et al.
Pubblicazione: (2025)
di: Skender, Ilhan, et al.
Pubblicazione: (2025)
HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning
di: Ke, Fucai, et al.
Pubblicazione: (2024)
di: Ke, Fucai, et al.
Pubblicazione: (2024)
On the Promise for Assurance of Differentiable Neurosymbolic Reasoning Paradigms
di: Richards, Luke E., et al.
Pubblicazione: (2025)
di: Richards, Luke E., et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
di: Xu, Yichang, et al.
Pubblicazione: (2026) -
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
di: Ilhan, Fatih, et al.
Pubblicazione: (2026) -
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026) -
A Survey on Large Language Model-Based Game Agents
di: Hu, Sihao, et al.
Pubblicazione: (2024) -
Adversarial Attention Perturbations for Large Object Detection Transformers
di: Yahn, Zachary, et al.
Pubblicazione: (2025)