Computer Vision

Bibliotheken und Modelle für Computer Vision zur Bildanalyse, -generierung, OCR und Objekterkennung.

Repositories

Funktionsreicher Web-UI für Stable Diffusion. Unterstützt Text-to-Image, Image-to-Image, Outpainting, Inpainting sowie Erweiterungen, LoRA, benutzerdefinierte Embeddings und API.

Python
164.7k
6 months ago

Echtzeit-Gesichtstausch- und Video-Deepfake-Tool, das mit nur einem einzigen Bild funktioniert. Unterstützt Webcam-Streaming, Videoverarbeitung und mehrere GPU-Beschleunigungsoptionen einschließlich CUDA, CoreML und DirectML.

Python
96.2k
3 days ago

OpenCV ist eine Open-Source-Softwarebibliothek für Computer Vision und maschinelles Lernen. Sie bietet Echtzeit-optimierte Tools für Bildverarbeitung, Objekterkennung, Videoanalyse und KI-Modellausführung auf mehreren Plattformen und Programmiersprachen.

C++
90.7k
13 hours ago

Open-Source-OCR-Toolkit und Document-AI-Engine, die PDFs und Bilder in LLM-gerechte strukturierte Daten (JSON/Markdown) umwandelt. Bietet das SOTA-Leichtgewicht-VLM PaddleOCR-VL zur Dokumentenanalyse, PP-OCRv5 mit Unterstützung für über 100 Sprachen sowie tiefe Integration in RAG-/Agent-Ökosysteme wie Dify und RAGFlow.

Python
88.5k
a month ago

Tesseract OCR-Engine mit neuronalem Netzwerk (LSTM) Unterstützung für 100+ Sprachen. Enthält Kommandozeilentool und API-Bibliothek zur Textextraktion aus Bildern.

C++
76.3k
6 days ago

Stable Diffusion ist ein latentes Text-zu-Bild-Diffusionsmodell, das fotorealistische Bilder aus Textbeschreibungen erzeugt. Basierend auf latenter Diffusionsarchitektur mit CLIP-Textencoder ermöglicht es Bildsynthese, Bild-zu-Bild-Übersetzung und Inpainting.

Jupyter Notebook
73.4k
2 years ago
ultralytics/ultralytics

Ultralytics YOLO ist ein modernes Computer-Vision-Framework, das State-of-the-Art-Modelle für Objekterkennung, Segmentierung, Klassifizierung, Tracking und Pose-Schätzung bietet. Schnell, präzise und einfach zu bedienen mit umfangreichen Bereitstellungsoptionen.

Python
61.1k
10 hours ago
ultralytics/yolov5

YOLOv5 ist ein modernes Computer-Vision-Modell für Echtzeit-Objekterkennung, Segmentierung und Klassifizierung. Basierend auf PyTorch bietet es außergewöhnliche Geschwindigkeit, Genauigkeit und Benutzerfreundlichkeit.

Python
57.9k
3 days ago

FaceSwap ist ein Open-Source-Tool, das Deep Learning zur Erkennung und zum Austausch von Gesichtern in Bildern und Videos nutzt. Es bietet eine vollständige Pipeline aus Extraktion → Training → Konvertierung, unterstützt NVIDIA-, AMD ROCm-, Apple Silicon- und CPU-Backends und ist sowohl über CLI als auch GUI bedienbar.

Python
57.5k
a month ago

Eine leistungsstarke und einfache Python-Bibliothek für Gesichtserkennung mit 99.38% Genauigkeit im LFW-Benchmark. Bietet einfache API für Gesichtserkennung, Gesichtsmerkmalanalyse und Identitätserkennung mit Befehlszeilentools.

Python
56.7k
2 months ago

Meta AIs Segment Anything Model (SAM) ist ein bahnbrechendes Foundation-Modell für promptbare Bildsegmentierung. Es erzeugt hochwertige Objektmasken aus einfachen Prompts wie Punkten oder Rahmen, trainiert mit 11M Bildern und 1.1B Masken, und bietet außergewöhnliche Zero-Shot-Leistung über diverse Segmentierungsaufgaben hinweg.

Jupyter Notebook
54.7k
2 years ago