segment-anything-model
SAM: zero-shot image segmentation via points, boxes, masks.
[MultimodalImageSegmentationComputer
PoorRican
0
clip
OpenAI's model connecting vision and language. Enables zero-shot image classification, image-text matching, and cross-modal retrieval. Trained on 400M image-text pairs. Use for image search, content moderation, or vision-language tasks without fine-tuning. Best for general-purpose image understanding.
[MultimodalCLIPVision-LanguageZero-Shot
PoorRican
0
audiocraft-audio-generation
AudioCraft: MusicGen text-to-music, AudioGen text-to-sound.
[MultimodalAudioGenerationText-to-Music
PoorRican
0