Driving with Graph Visual Question Answering
Medical imaging toolkit for deep learning
Tools for manipulating datasets
State-of-the-art (SoTA) text-to-video pre-trained model
Unified framework for robot learning built on NVIDIA Isaac Sim
Fast3R: Towards 3D Reconstruction of 1000+ Images in One Forward Pass
Sharp Monocular View Synthesis in Less Than a Second
Tencent Hunyuan Multimodal diffusion transformer (MM-DiT) model
Pluggable SOTA multi-object tracking modules for segmentation
Tiny vision language model
[CVPR 2025 Best Paper Award] VGGT
Streaming Real-time Audio-Driven Avatar Generation
Official implementation of Watermark Anything with Localized Messages
Deep and Machine Learning for Microscopy
MapAnything: Universal Feed-Forward Metric 3D Reconstruction
ImageBind One Embedding Space to Bind Them All
PyTorch code and models for VJEPA2 self-supervised learning from video
A simple program to create stop-motion animations with your webcam
Open-source AI video pipeline, fully automated with MCP
Overcoming Data Limitations for High-Quality Video Diffusion Models
AI Suite for upscaling, interpolating & restoring images/videos
Monitorización y Control de una instalación FV
Matches OpenScience Observatories images with astronomical catalogs
Random phenomena generator