SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Wanhua, Meng, Zibin, Zhou, Jiawei, Wei, Donglai, Gan, Chuang, Pfister, Hanspeter |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
por: He, Jixuan, et al.
Publicado: (2024)
por: He, Jixuan, et al.
Publicado: (2024)
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
por: Hou, Karly, et al.
Publicado: (2025)
por: Hou, Karly, et al.
Publicado: (2025)
LangSplat: 3D Language Gaussian Splatting
por: Qin, Minghan, et al.
Publicado: (2023)
por: Qin, Minghan, et al.
Publicado: (2023)
Tree of Attributes Prompt Learning for Vision-Language Models
por: Ding, Tong, et al.
Publicado: (2024)
por: Ding, Tong, et al.
Publicado: (2024)
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
por: Liu, Ye, et al.
Publicado: (2024)
por: Liu, Ye, et al.
Publicado: (2024)
LangSplatV2: High-dimensional 3D Language Gaussian Splatting with 450+ FPS
por: Li, Wanhua, et al.
Publicado: (2025)
por: Li, Wanhua, et al.
Publicado: (2025)
S$^3$-TTA: Scale-Style Selection for Test-Time Augmentation in Biomedical Image Segmentation
por: Xie, Kangxian, et al.
Publicado: (2023)
por: Xie, Kangxian, et al.
Publicado: (2023)
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
por: Liu, Yilong, et al.
Publicado: (2026)
por: Liu, Yilong, et al.
Publicado: (2026)
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
por: Wu, Chenyu, et al.
Publicado: (2026)
por: Wu, Chenyu, et al.
Publicado: (2026)
4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models
por: Li, Wanhua, et al.
Publicado: (2025)
por: Li, Wanhua, et al.
Publicado: (2025)
Joint-Task Regularization for Partially Labeled Multi-Task Learning
por: Nishi, Kento, et al.
Publicado: (2024)
por: Nishi, Kento, et al.
Publicado: (2024)
TriSAM: Tri-Plane SAM for zero-shot cortical blood vessel segmentation in VEM images
por: Wan, Jia, et al.
Publicado: (2024)
por: Wan, Jia, et al.
Publicado: (2024)
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
por: Liu, Yifan, et al.
Publicado: (2025)
por: Liu, Yifan, et al.
Publicado: (2025)
MoRA: LoRA Guided Multi-Modal Disease Diagnosis with Missing Modality
por: Shi, Zhiyi, et al.
Publicado: (2024)
por: Shi, Zhiyi, et al.
Publicado: (2024)
Learning Gaze-aware Compositional GAN
por: Aranjuelo, Nerea, et al.
Publicado: (2024)
por: Aranjuelo, Nerea, et al.
Publicado: (2024)
Frenet-Serret Frame-based Decomposition for Part Segmentation of 3D Curvilinear Structures
por: Gu, Leslie, et al.
Publicado: (2024)
por: Gu, Leslie, et al.
Publicado: (2024)
Generalization of CNNs on Relational Reasoning with Bar Charts
por: Cui, Zhenxing, et al.
Publicado: (2025)
por: Cui, Zhenxing, et al.
Publicado: (2025)
Towards 1000-fold Electron Microscopy Image Compression for Connectomics via VQ-VAE with Transformer Prior
por: Yang, Fuming, et al.
Publicado: (2025)
por: Yang, Fuming, et al.
Publicado: (2025)
Understanding Graphical Perception in Data Visualization through Zero-shot Prompting of Vision-Language Models
por: Guo, Grace, et al.
Publicado: (2024)
por: Guo, Grace, et al.
Publicado: (2024)
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance
por: Xu, Tianling, et al.
Publicado: (2025)
por: Xu, Tianling, et al.
Publicado: (2025)
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models
por: Liu, Yifan, et al.
Publicado: (2025)
por: Liu, Yifan, et al.
Publicado: (2025)
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
por: Gu, Leslie, et al.
Publicado: (2025)
por: Gu, Leslie, et al.
Publicado: (2025)
Ella: Embodied Social Agents with Lifelong Memory
por: Zhang, Hongxin, et al.
Publicado: (2025)
por: Zhang, Hongxin, et al.
Publicado: (2025)
Skip and Skip: Segmenting Medical Images with Prompts
por: Chen, Jiawei, et al.
Publicado: (2024)
por: Chen, Jiawei, et al.
Publicado: (2024)
Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts
por: Kao, Shiu-hong, et al.
Publicado: (2025)
por: Kao, Shiu-hong, et al.
Publicado: (2025)
Multimodal Learning for Embryo Viability Prediction in Clinical IVF
por: Kim, Junsik, et al.
Publicado: (2024)
por: Kim, Junsik, et al.
Publicado: (2024)
Sentinel: Embodied Cooperative Spatial Reasoning and Planning
por: Lin, Xiangye, et al.
Publicado: (2026)
por: Lin, Xiangye, et al.
Publicado: (2026)
3DAxisPrompt: Promoting the 3D Grounding and Reasoning in GPT-4o
por: Liu, Dingning, et al.
Publicado: (2025)
por: Liu, Dingning, et al.
Publicado: (2025)
Prompting Segment Anything Model with Domain-Adaptive Prototype for Generalizable Medical Image Segmentation
por: Wei, Zhikai, et al.
Publicado: (2024)
por: Wei, Zhikai, et al.
Publicado: (2024)
Medal S: Spatio-Textual Prompt Model for Medical Segmentation
por: Shi, Pengcheng, et al.
Publicado: (2025)
por: Shi, Pengcheng, et al.
Publicado: (2025)
In-distribution adversarial attacks on object recognition models using gradient-free search
por: Madan, Spandan, et al.
Publicado: (2021)
por: Madan, Spandan, et al.
Publicado: (2021)
Improving generalization by mimicking the human visual diet
por: Madan, Spandan, et al.
Publicado: (2022)
por: Madan, Spandan, et al.
Publicado: (2022)
Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation
por: Nazer, Nadeem, et al.
Publicado: (2025)
por: Nazer, Nadeem, et al.
Publicado: (2025)
Evolving, Not Training: Zero-Shot Reasoning Segmentation via Evolutionary Prompting
por: Ye, Kai, et al.
Publicado: (2025)
por: Ye, Kai, et al.
Publicado: (2025)
A Rigorous Behavior Assessment of CNNs Using a Data-Domain Sampling Regime
por: Jiang, Shuning, et al.
Publicado: (2025)
por: Jiang, Shuning, et al.
Publicado: (2025)
Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning
por: Si, Chongjie, et al.
Publicado: (2024)
por: Si, Chongjie, et al.
Publicado: (2024)
Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models
por: Magid, Salma Abdel, et al.
Publicado: (2024)
por: Magid, Salma Abdel, et al.
Publicado: (2024)
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
por: Wang, Xijun, et al.
Publicado: (2025)
por: Wang, Xijun, et al.
Publicado: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
por: Guo, Pinxue, et al.
Publicado: (2024)
por: Guo, Pinxue, et al.
Publicado: (2024)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
por: Lalai, Harsh Nishant, et al.
Publicado: (2026)
por: Lalai, Harsh Nishant, et al.
Publicado: (2026)
Ejemplares similares
-
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
por: He, Jixuan, et al.
Publicado: (2024) -
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
por: Hou, Karly, et al.
Publicado: (2025) -
LangSplat: 3D Language Gaussian Splatting
por: Qin, Minghan, et al.
Publicado: (2023) -
Tree of Attributes Prompt Learning for Vision-Language Models
por: Ding, Tong, et al.
Publicado: (2024) -
$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
por: Liu, Ye, et al.
Publicado: (2024)