Omniverse: Audio2Face Tutorial

Audio2Face ist ein KI-gestütztes Tool innerhalb von NVIDIA Omniverse, das speziell dafür entwickelt wurde, realistische Gesichtsanimationen allein auf Basis von Audio zu erzeugen. Es gehört zur Omniverse-Plattform, die eine Echtzeit-Kollaborations- und Simulationsumgebung für 3D-Workflows bietet. Audio2Face nutzt ein neuronales Netzwerk, um gesprochene Sprache automatisch in lebendige Mimik und Gesichtsbewegungen umzuwandeln. Typischerweise verwendet man Audio2Face, um Charaktere in Spielen, Filmen oder digitalen Avataren sprechen zu lassen, ohne aufwendige Keyframe-Animationen. Die erzeugten Bewegungen können entweder direkt verwendet oder auf eigene 3D-Charaktere übertragen werden, was besonders für virtuelle Produktionen, digitale Zwillinge oder interaktive Anwendungen interessant ist. ...

KI-gestützter Event-Agent für Veranstaltungen

In diesem Projekt habe ich einen KI-Agenten entwickelt, der automatisch Veranstaltungen aus dem Raum NRW analysiert und nach persönlichen Kriterien filtert. Ziel war es, aus einer großen Menge Events nur diejenigen herauszufiltern, die wirklich relevant sind – basierend auf einem individuell definierten Prompt. Dieses Bild zeigt die Liste von über 350 Events, die an einem einzigen Tag in Düsseldorf stattfinden. In ganz NRW sind es an einem Tag mehrere tausend Veranstaltungen. ...

LLMs sind kein Allheilmittel: Praxistest zur Musik-Klassifikation anhand von Metadaten

Die Fragestellung war, ob aktuelle Large Language Models (LLMs) wie GPT-4 oder DeepSeek in der Lage sind, Musikstücke – speziell Salsa-Songs – anhand von Titel, Künstler, Songtext und Metadaten automatisch und zuverlässig in „Salsa Cubana“ oder „Salsa Línea“ zu klassifizieren. Es war bekannt, dass die Informationslage (Metadaten, Genre-Tags, Lyrics) lückenhaft und teilweise uneinheitlich ist. Der Test diente explizit dazu, die praktischen Grenzen heutiger LLMs in diesem Kontext zu ermitteln. ...

Omniverse Tutorial

Was ist Omniverse? Omniverse ist eine Plattform von NVIDIA, mit der man virtuelle 3D-Welten erstellen, verbinden und simulieren kann – und das in Echtzeit. Omniverse ist eine offene Plattform für Entwickler, Designer, Ingenieure, Forscher und Kreative, um: 3D-Anwendungen miteinander zu verbinden (z. B. Blender, Maya, Unreal Engine) Gemeinsam in einer einzigen Szene zu arbeiten – live und gleichzeitig. Physikalisch realistische Simulationen und KI-gesteuerte Anwendungen zu erstellen. Wofür wird Omniverse verwendet? Design, Visualisierung & Simulation von Objekten wie beispielsweise Fahrzeugen in Echtzeit. ...

Wan 2.1 mit ComfyUI inkl. GPU Support lokal einrichten

ComfyUI ist eine node-basierte Benutzeroberfläche zur Steuerung und Modifikation von KI-Modellen zur Bild- und Videoerstellung. Wan 2.1 ist ein Text-to-Video-Modell (T2V), das speziell für die Generierung von Videos auf Basis von Texteingaben entwickelt wurde. Diese Anleitung beschreibt Schritt für Schritt, wie ComfyUI mit Wan 2.1 lokal eingerichtet wird. Jeder Abschnitt erklärt die benötigten Komponenten, warum sie notwendig sind und wie sie korrekt installiert werden. Diese Anleitung setzt Python 10 und eine GPU mit CUDA-Support voraus. ...

Prompt Decorators: KI-Antworten gezielt steuern

KI-Modelle liefern oft unstrukturierte oder unpräzise Antworten. Wer bessere Ergebnisse möchte, muss seine Prompts entsprechend anpassen. Eine Möglichkeit, dies effizient zu tun, sind Prompt Decorators – klare Anweisungen am Anfang eines Prompts, die das Antwortverhalten der KI steuern. In diesem Beitrag zeige ich, wie man der KI beibringt, diese Decorators zu verstehen und wie man sie anschließend nutzt. Prompt Decorators der KI erklären Die KI erhält eine klare Definition der Decorators z.B. „+++StrukturierteAntwort“, damit sie deren Bedeutung versteht. Die Anweisung, sie in zukünftigen Antworten zu berücksichtigen, sorgt dafür, dass sie nicht nur für eine einzelne Frage gelten. Falls die KI keinen Langzeitspeicher hat, muss diese Einführung bei jeder neuen Sitzung wiederholt werden. ...

KI-Agent Demo: Erweiterte Spam-Erkennung via ChatGPT

In diesem Projekt habe ich eine Thunderbird-Erweiterung entwickelt, die ChatGPT zur erweiterten Spam-Erkennung nutzt. Eingehende E-Mails werden automatisch analysiert und anhand verschiedener Kriterien klassifiziert. Ein lokaler Flask-Server übernimmt die Kommunikation mit ChatGPT und bewertet, ob eine Nachricht als Spam einzustufen ist. Die Umsetzung dient als Demo, um die Möglichkeiten einer KI-gestützten Filterung in Thunderbird zu erproben. Ablauf Sobald Thunderbird eine neue E-Mail empfängt, wird die Erweiterung aktiv. Die Nachricht wird abgefangen, bevor sie vom Nutzer gelesen wird. Die Erweiterung extrahiert den Betreff, den Absender und den E-Mail-Text. ...

Ollama inkl. Modelle mit NVIDIA GPU-Unterstützung unter Docker offline ausführen + OpenWebUI

Hier wurde Ollama mit NVIDIA-GPU-Unterstützung unter Docker auf einem Windows-11-System ausgeführt. Dabei kam OpenWebUI als benutzerfreundliche Oberfläche zum Einsatz, um lokal KI-Modelle zu betreiben. OpenWebUI bietet den Vorteil, dass Nutzer einfach zwischen verschiedenen Modellen wechseln, Anfragen verwalten und die Nutzung der KI komfortabel über eine grafische Oberfläche steuern können. Zudem ermöglicht es eine bessere Übersicht über laufende Instanzen und erleichtert das Testen unterschiedlicher Modelle ohne manuelle Konfigurationsänderungen. WSL 2 Installieren NVIDIA CUDA-Treiber installieren Damit Docker-Container auf die GPU zugreifen können, wird die NVIDIA Container Runtime benötigt. Dies ermöglicht eine schnellere und effizientere Berechnung von KI-Modellen, da rechenintensive Prozesse nicht von der CPU, sondern von der leistungsfähigeren GPU übernommen werden. https://developer.nvidia.com/cuda/wsl ...

Neuronales Netzwerk mit MNIST und TensorFlow

Dieser Code zeigt, wie ein künstliches neuronales Netzwerk mit dem MNIST-Datensatz trainiert wird, um handgeschriebene Ziffern (0-9) zu klassifizieren. Ziel ist es, dass das Modell anhand der Bilddaten vorhersagen kann, welche Ziffer abgebildet ist. Dies wird erreicht durch: 1. Laden und Vorverarbeiten der MNIST-Bilddaten. 2. Erstellen eines neuronalen Netzwerks mit mehreren Schichten (Layers). 3. Trainieren des Netzwerks mit Trainingsdaten. 4. Evaluieren der Leistung des Modells auf Testdaten. 5. Testen des Modells auf neuen Beispieldaten. ...

Ollama mit llama3.2/3.3/DeepSeekv3 lokal verwenden + REST Aufruf.

Ollama LLM-Laufzeitumgebung downloaden und installieren. Nach der Installation kann der Server unter http://127.0.0.1:11434/ aufgerufen werden. 3. Liste der installierten Modelle anzeigen lassen. Die Liste sollte leer sein. ollama list 4. llama3.2 LLM und DeepSeekv3 (404 GB HD & 413GB RAM) downloaden. ollama pull llama3.2 ollama pull deepseek-v3 Auf der Webseite von Meta sind die aktuellen Versionen des LLMs zu finden. 5. llama3 starten. ollama run llama3.2 Das Sprachmodell lässt sich mit “Ctrl + d” oder mit dem Kommando “/bye” anhalten. ...

Spring AI / OpenAI Tutorial

Frage via Spring AI an OpenAI senden und die Antwort anzeigen OpenAI Key erstellen https://platform.openai.com/settings/organization/api-keys Anschließend den Key als Umgebungsvariable setzen: OPENAI_API_KEY Neues Spring Boot Projekt erstellen: https://start.spring.io/ Innerhalb der Spring Boot Anwendung bzw. der “application.properties” Datei den OpenAI Key bzw. Umgebungsvariable (OPENAI_API_KEY) referenzieren. Nachdem wir das Interface und die Klassen erstellt haben, sollte die Projektstruktur wie folgt aussehen: Nachdem Ausführen des Unit-Tests, sollte auf die Frage “Who would win in a fight between Superman and Chuck Norris?” die Antwort angezeigt werden. In diesem Fall: ...

Whisper: Automatische Transkription von Videos in Text

In diesem Beitrag erkläre ich dir, wie du Whisper, ein KI-basiertes Tool von OpenAI, zur automatischen Transkription von Videos verwenden kannst. Whisper ist in der Lage, gesprochene Sprache in verschiedenen Sprachen – einschließlich Deutsch – präzise in Text umzuwandeln. Damit eignet es sich hervorragend, um z. B. Interviews, Vorträge oder persönliche Videos zu transkribieren. Python 3.10 installieren Whisper setzt die Programmiersprache Python voraus und benötigt eine Version zwischen 3.7 und 3.10. In dieser Anleitung verwenden wir Python 3.10, um Kompatibilitätsprobleme zu vermeiden. ...

DNS über HTTPS (DoH) innerhalb von Firefox einstellen

Erweiterte Firefox Einstellungen aufrufen: about:config network.trr.mode von 0 auf 2 umstellen. network.trr.uri auf https://mozilla.cloudflare-dns.com/dns-query umstellen. network.trr.mode ist eine Konfigurationseinstellung in Firefox, die die Verwendung von DNS over HTTPS (DoH) steuert. TRR steht für Trusted Recursive Resolver und bezieht sich auf die Verwendung von DoH, um DNS-Anfragen über eine verschlüsselte HTTPS-Verbindung zu senden, anstatt über herkömmliche, unverschlüsselte DNS-Abfragen. 0 – DoH ist deaktiviert: Firefox verwendet ausschließlich das normale, unverschlüsselte DNS (über UDP oder TCP) und schickt keine DNS-Anfragen über HTTPS. ...

Embedding via ChromaDB Vektordatenbank

Dieser Blogbeitrag behandelt das Konzept von Embeddings und Vektordatenbanken. Dabei wird zunächst erklärt, was Embeddings sind und wie sie im Bereich des Natural Language Processing (NLP) genutzt werden. Anschließend folgt eine Erklärung der Vektoren in einem Raum mit drei Koordinaten und deren Erweiterung auf mehrdimensionale Vektoren. Schließlich wird ChromaDB vorgestellt, eine spezialisierte Vektordatenbank. Was ist ein Embedding? Ein Embedding ist eine Technik im Bereich des maschinellen Lernens und der Datenverarbeitung, die darauf abzielt, Objekte wie Wörter, Sätze oder Dokumente in einen kontinuierlichen Vektorraum zu transformieren. In diesem Vektorraum sind ähnliche Objekte durch ähnliche Vektoren repräsentiert, was bedeutet, dass sie nahe beieinander liegen. Embeddings werden häufig verwendet, um die semantische Bedeutung von Texten zu erfassen und zu analysieren. ...

Chatbot UI via Streamlit

Anfragen 1:1 via Streamlit an ChatGPT weiterleiten und die Antwort anzeigen. streamlit run ChatUI.py

LangChain & ChatGPT

Sende Nachricht via LangChain an ChatGPT Hier senden wir eine Nachricht via LangChain an ChatGPT und geben die Antwort aus. Mit “chain” eine Verkettung vornehmen Benutze “chain” um das Model und den Parsen miteinander zu verketten. Template Prompts Die Prompts mit einem Template vorbereiten. Verwende das Template: Die Zielsprache wird ausgelagert: Weitere Verkettungen Verkette das Template mit model & parser: Server via FastAPI & REST Endpoint Erstelle via FastAPI einen Server. Der Server lädt die Anwendung (app.py), nimmt die REST Anfrage entgegen und gibt die Übersetzung aus: ...

Elastic Stack (Filebeat, Logstash, Elasticearch, Kibana) Tutorial

Logstash Logstash is an Event Processing Framework. With Logstach you can import data from different kind of input frameworks and sources. In the next step you can filter an modify the data and in the last step you can export the data to different kind of formats and frameworks e.g. you can read the data from a framework like Beats and forward the data to Elasticsearch for storage and further processing. Within Logstash you can process, filter and map the different input and output formats: ...

Turn on/off Elgato Key Light via Windows shortcut/button

Search for the IP address of your Key Light via Wireless Network Watcher e.g. 192.168.2.227 Your Key Light has a build in web server listening on port 9123 e.g. 192.168.2.227:9123 Send a GET request e.g. via Postman to the following endpoint to get more information about your Key Light: http://192.168.2.227:9123**/elgato/lights** Turn on the light by using the following PUT request. You need to set the ‘on’ value to ‘1’ instead of ‘0’. ...

Fotografie Grundlagen + scharfe Langzeitbelichtung- & Landschaftsaufnahmen

Bessere Qualität: https://www.flickr.com/photos/aaron_kreis/13591624245/ Bessere Qualität: https://www.flickr.com/photos/aaron_kreis/35959541982/ Um gestochen scharfe Langzeitbelichtungsaufnahmen zu erstellen, muss man einige Grundbegriffe in der Fotografie kennen und seine Kamera entsprechend einstellen bzw. konfigurieren. Ich erkläre erst einmal die Begriffe ganz oberflächlich und gehe später auf die Wechselwirkung der Begriffe ein z.B. welchen Einfluss hat der ISO-Wert auf die Belichtungszeit etc. Wer Bilder wie oben abgebildet selber erstellen möchte, sollte die folgenden Grundbegriffe und deren Abhängigkeiten zueinander kennen. ...

Angular & Cumulocity IoT Plattform

Die folgenden Themen werden hier beschrieben: Installation der Cumulocity IoT Plattform (C8Y) CLI Projekt Erstellung via C8Y CLI Erstellung von Komponenten Erstellung einer Navigation (Routing) Custom Branding & Verwendung von Bootstrap 4 statt 3 (default) Zunächst einmal benötigen wir die Cumulocity (C8Y) Angular CLI (Command Line Interface). Die CLI können wir wie folgt installieren: npm install -g @c8y/cli Anhand der C8Y CLI kann ein neues Projekt wie folgt erstellt werden: c8ycli new myApp ...