OpenDesign MCP Pipeline to kompletny, lokalny system do generowania treści audio-wideo z wykorzystaniem sztucznej inteligencji — od tekstu, przez narrację lektorską (TTS), aż po gotowy film z animacjami i proceduralną muzyką.

Działa w całości lokalnie, bez wysyłania danych do zewnętrznych chmur. Wszystkie obliczenia odbywają się na własnym sprzęcie. Pipeline łączy najnowsze osiągnięcia w dziedzinie syntezy mowy, generowania wideo, animacji komputerowych i proceduralnej produkcji muzyki.

Własna infrastruktura — pełna kontrola nad danymi i procesami
Modularna architektura — każdy komponent można rozwijać niezależnie
Otwarte standardy — komunikacja przez MCP (Model Context Protocol)

OpenDesign MCP Pipeline is a complete, fully local system for generating audio-video content using artificial intelligence — from text, through voiceover narration (TTS), to a finished film with animations and procedural music.

Everything runs entirely locally, without sending data to external clouds. All computations happen on your own hardware. The pipeline combines the latest advances in speech synthesis, video generation, computer animation, and procedural music production.

Own infrastructure — full control over data and processes
Modular architecture — each component can be developed independently
Open standards — communication via MCP (Model Context Protocol)

Można wygenerować
What you can generate
Narracja lektorska (TTS)edge-tts (brytyjski, polski) + klony głosów VibeVoice (seb, sonia, ryan)
Narration / voiceover (TTS)edge-tts (British, Polish) + VibeVoice voice clones (seb, sonia, ryan)
Obrazy AIFLUX.2 Klein 4B przez InvokeAI — plakat, okładka, grafika
AI imagesFLUX.2 Klein 4B via InvokeAI — posters, covers, artwork
Filmy z voiceoveremPrezentacje produktów, dema, klipy promocyjne
Videos with voiceoverProduct presentations, demos, promo clips
Filmy z AI videoKlipy generowane przez modele Wan2.2 (text-to-video)
AI video filmsClips generated by Wan2.2 models (text-to-video)
Wyszukiwanie w archiwummedia_search — reusable assets zamiast ponownej generacji (search-first)
Archive searchmedia_search — reuse existing assets instead of regenerating (search-first)
Typowy scenariusz
Typical workflow
Tekst → synteza mowy (TTS) → kompozycja wizualna z animacjami i muzyką → render do formatu MP4 → gotowy materiał wideo w projekcie Text → TTS synthesis → visual composition with animations and music → MP4 render → ready video material in the project
Przykład użycia MCP
MCP usage example

Wywołanie bramki MCP z poziomu CLI (anonymized — adres, port i token zastępcze):

Calling the MCP gateway from the CLI (anonymized — address, port, and token are placeholders):

# synteza mowy (TTS) — zwraca audio (base64)# speech synthesis (TTS) — returns audio (base64)
curl -X POST https://gateway.example.local:11799/api/tts \
  -H "Authorization: Bearer <token>" -H "Content-Type: application/json" \
  -d '{"text":"Witaj świecieHello world","voice":"<voice_id>"}'

# generowanie obrazu (FLUX.2 / InvokeAI) — zwraca png (base64)# image generation (FLUX.2 / InvokeAI) — returns png (base64)
curl -X POST https://gateway.example.local:11799/api/image \
  -H "Authorization: Bearer <token>" -H "Content-Type: application/json" \
  -d '{"prompt":"czerwone koło na białym tlea red circle on white background","size":"1024x1024"}'

# listowanie dostępnych głosów TTS# list available TTS voices
curl https://gateway.example.local:11799/api/voices -H "Authorization: Bearer <token>"
Stack technologiczny
Tech stack
MCP Gateway edge-tts VibeVoice Wan2.2 InvokeAI · FLUX.2 HyperFrames GSAP WebGL / Canvas Web Audio API Chromium render SearXNG Qdrant media archive

OpenDesign MCP Pipeline to kompletny, lokalny pipeline do generowania treści audio-wideo z wykorzystaniem sztucznej inteligencji — od tekstu, przez narrację, aż po gotowy film z animacjami i proceduralną muzyką.

Działa w całości lokalnie, bez wysyłania danych do zewnętrznych chmur. Wszystkie obliczenia odbywają się na własnym sprzęcie — GPU Radeon 7900 XTX, CPU AMD, Ubuntu. Brak kosztów API, brak limitu zapytań, brak ryzyka wycieku danych.

Pipeline to nie pojedynczy program — to zbiór modułów, każdy o osobnej odpowiedzialności, komunikujących się przez otwarty protokół MCP (Model Context Protocol). Oznacza to, że każdy komponent można rozwijać, wymieniać lub skalować niezależnie od reszty systemu.

OpenDesign MCP Pipeline is a complete, fully local system for generating audio-video content using artificial intelligence — from text, through narration, to a finished film with animations and procedural music.

It runs entirely locally, without sending data to external clouds. All computations happen on your own hardware — Radeon 7900 XTX GPUs, AMD CPU, Ubuntu. No API costs, no request limits, no risk of data leaks.

The pipeline is not a single program — it's a collection of modules, each with its own responsibility, communicating via the open MCP (Model Context Protocol) standard. This means each component can be developed, replaced, or scaled independently from the rest of the system.

Trzy filary projektu
Three pillars
Własna infrastruktura
Own Infrastructure
Pełna kontrola nad danymi i procesami — zero zależności od zewnętrznych dostawców AI.
Full control over data and processes — zero dependency on external AI providers.
Modułowa architektura
Modular Architecture
Każdy komponent działa niezależnie. Nowe moduły można dodawać bez zmiany istniejących.
Each component runs independently. New modules can be added without modifying existing ones.
Otwarte standardy
Open Standards
Komunikacja przez MCP — moduły mogą być napisane w różnych językach (Python, TypeScript, bash).
Communication via MCP — modules can be written in different languages (Python, TypeScript, bash).

Pipeline składa się z siedmiu głównych modułów — każdy odpowiedzialny za inny etap przetwarzania, od tekstu wejściowego po gotowy plik wideo.

The pipeline consists of seven main modules — each responsible for a different processing stage, from input text to the final video file.

Moduł 1 — Bramka MCP (Model Context Protocol)

Module 1 — MCP Bridge (Model Context Protocol)

Centralny punkt integracji wszystkich usług AI (FastMCP, port 11799). Udostępnia narzędzia MCP + REST API do komunikacji między komponentami pipeline'u.

● text_to_speech / generate_video / generate_image (kolejka asynchroniczna)
● media_search / media_register — centralne archiwum mediów (search-first)
● search_web (SearXNG) · qdrant_search (wektory) · list_voices
● get_job_status / cancel_job — zarządzanie zadaniami (5 poziomów priorytetów)

Central integration point for all AI services (FastMCP, port 11799). Exposes MCP tools + REST API for communication between pipeline components.

● text_to_speech / generate_video / generate_image (async job queue)
● media_search / media_register — central media archive (search-first)
● search_web (SearXNG) · qdrant_search (vectors) · list_voices
● get_job_status / cancel_job — job management (5 priority levels)

Moduł 2 — Synteza mowy (TTS)

Module 2 — Text-to-Speech (TTS)

Generowanie naturalnie brzmiącej mowy z tekstu. Dwa silniki:

VibeVoice (lokalnie, GPU) — klony głosów: seb, sonia (brytyjska), ryan (brytyjski), cross-lingual EN+PL
edge-tts (chmura, bez GPU) — brytyjski premium, brytyjski szybki, polski

Generowanie: ~1-2 s (edge-tts) · ~5-15 s (VibeVoice) · Wybór głosu przez MCP

Generating natural-sounding speech from text. Two engines:

VibeVoice (local, GPU) — voice clones: seb, sonia (British), ryan (British), cross-lingual EN+PL
edge-tts (cloud, no GPU) — British premium, British fast, Polish

Generation: ~1-2 s (edge-tts) · ~5-15 s (VibeVoice) · Voice selection via MCP

Moduł 3 — Generator wideo (Wan2.2)

Module 3 — Video Generator (Wan2.2)

Generowanie filmów z opisu tekstowego: model Wan2.2 TI2V 5B (Diffusers) — text-to-video. Dedykowany backend FastAPI (ai-video-gateway) z zarządzaniem pamięcią VRAM, kolejkowaniem i auto-unload po okresie bezczynności.

Formaty: MP4 · Rozdzielczość: do 1024×1024 · 77 klatek / ~5 s

Generating video from text descriptions: Wan2.2 TI2V 5B model (Diffusers) — text-to-video. Dedicated FastAPI backend (ai-video-gateway) with VRAM management, job queuing, and auto-unload after idle time.

Formats: MP4 · Resolution: up to 1024×1024 · 77 frames / ~5 s

Moduł 4 — Generowanie obrazów (InvokeAI)

Module 4 — Image Generation (InvokeAI)

Generowanie obrazów przez InvokeAI: model FLUX.2 Klein 4B (GGUF Q4). Obsługa większych rozdzielczości przez upscaling SwinIR x4.

● Rozdzielczość: do 1024×1024 (auto-upscale powyżej)
● Upscaler: auto (SwinIR x4) / lanczos / none
● Liczba kroków (steps), cfg_scale, seed — konfigurowalne

Image generation via InvokeAI: FLUX.2 Klein 4B (GGUF Q4) model. Larger resolutions handled via SwinIR x4 upscaling.

● Resolution: up to 1024×1024 (auto-upscale beyond)
● Upscaler: auto (SwinIR x4) / lanczos / none
● Steps, cfg_scale, seed — configurable

Moduł 5 — Silnik kompozycji HyperFrames

Module 5 — HyperFrames Composition Engine

Tworzenie zaawansowanych kompozycji wideo w HTML:

● Sceny z płynnymi przejściami
● Animacje GSAP (fade, slide, stagger, rotacja, skalowanie)
● Nakładanie wielu ścieżek audio (narracja + muzyka)
● Canvas WebGL z cząsteczkami i efektami
● Proceduralna muzyka przez Web Audio API
● Deterministiczny render (powtarzalność klatek)

Creating advanced video compositions in HTML:

● Scenes with smooth transitions
● GSAP animations (fade, slide, stagger, rotation, scaling)
● Multi-track audio overlay (narration + music)
● WebGL Canvas with particles and effects
● Procedural music via Web Audio API
● Deterministic rendering (frame reproducibility)

Moduł 6 — Silnik renderowania

Module 6 — Render Engine

Przetwarzanie kompozycji na gotowy plik wideo. Wykorzystuje przeglądarkę Chromium do renderowania, obsługuje renderowanie równoległe z wieloma workerami.

Wiele formatów wyjściowych: MP4, WebM, MOV, GIF

Processing compositions into finished video files. Uses Chromium browser for rendering with parallel processing (multiple workers).

Multiple output formats: MP4, WebM, MOV, GIF

Moduł 7 — Zarządzanie GPU

Module 7 — GPU Management

Inteligentne zarządzanie zasobami obliczeniowymi — przed każdą generacją sprawdzana jest wolna pamięć VRAM:

● Automatyczne wykrywanie dostępnej pamięci VRAM (ensure_free_vram)
● Kolejkowanie zadań oczekujących na GPU
● Auto-unload modeli po okresie bezczynności (frees VRAM)
● Priorytetyzacja zadań (5 poziomów)

Intelligent compute resource management — free VRAM is checked before every generation:

● Automatic available VRAM detection (ensure_free_vram)
● Queuing of tasks waiting for GPU
● Auto-unload of idle models (frees VRAM)
● Task prioritization (5 levels)

Wszystkie moduły pipeline'u są ze sobą połączone za pomocą protokołu MCP (Model Context Protocol) — otwartego standardu umożliwiającego komunikację między serwisami AI.

All pipeline modules are interconnected via the MCP (Model Context Protocol) — an open standard enabling communication between AI services.

MCP — BRAMKA CENTRALNAMCP — CENTRAL GATEWAY
TTSSynteza mowySpeech Synthesis
Wan2.2Generator wideoVideo Generator
FLUX.2Generator obrazówImage Generator
HyperFramesSilnik kompozycjiComposition Engine
ChromiumSilnik renderowaniaRender Engine
VRAMZarządzanie GPUGPU Management
AsyncKolejka zadańTask Queue
ArchiveArchiwum mediówMedia Archive
Klient (web / CLI) wysyła zlecenie przez MCPClient (web / CLI) sends a request via MCP
Bramka MCP przyjmuje zlecenie i dodaje do kolejkiMCP gateway receives the request and queues it
Kolejka priorytetowa przydziela zadanie do odpowiedniego modułuPriority queue assigns the task to the right module
Moduł wykonuje zadanie (np. TTS → synteza mowy)Module executes the task (e.g. TTS → speech synthesis)
Wynik wraca przez bramkę MCP do klientaResult returns through the MCP gateway to the client
Kolejne zadanie (kompozycja + render) uruchamiane automatycznieNext task (composition + render) launches automatically

Architektura oparta na MCP (Model Context Protocol) dostarcza kluczowych korzyści, które czynią ten pipeline wydajnym, skalowalnym i przyszłościowym.

An architecture based on the MCP (Model Context Protocol) delivers key benefits that make this pipeline efficient, scalable, and future-proof.

Jednolity interfejs
Unified Interface
Każdy moduł komunikuje się przez ten sam protokół — brak potrzebnego adapterowania.
Each module communicates via the same protocol — no need for ad-hoc adapters.
Rozdzielenie odpowiedzialności
Separation of Concerns
Każdy moduł działa niezależnie — awaria jednego nie blokuje całego systemu.
Each module runs independently — failure of one doesn't block the entire system.
Skalowalność
Scalability
Można dodawać nowe moduły bez zmiany istniejących — architektura rośnie razem z potrzebami.
New modules can be added without changing existing ones — the architecture grows with your needs.
Asynchroniczność
Asynchronicity
Długotrwałe zadania nie blokują innych operacji — kolejka priorytetowa zarządza kolejkowaniem.
Long-running tasks don't block other operations — the priority queue manages queuing.
Niezależność językowa
Language Independence
Moduły mogą być napisane w różnych językach (Python, TypeScript, bash) i komunikować się przez MCP.
Modules can be written in different languages (Python, TypeScript, bash) and communicate via MCP.
Determinizm
Determinism
Render jest deterministyczny — gwarantuje identyczne wyniki przy powtarzalnych danych wejściowych.
Rendering is deterministic — it guarantees identical results with reproducible input data.

Pełny cykl życia zadania — od momentu zlecenia przez klienta do wygenerowania gotowego filmu MP4.

The full lifecycle of a task — from the moment a client submits a request to the generation of a finished MP4 video.

01
Wstęp:Entry: Klient (aplikacja web / CLI) wysyła zlecenie z tekstem wejściowym przez MCP.Client (web / CLI) sends a request with input text via MCP.
02
Archiwum:Archive: Bramka sprawdza centralne archiwum mediów — pasujący zasób jest wykorzystany zamiast ponownej generacji.The gateway checks the central media archive — a matching asset is reused instead of regenerating.
03
Bramka MCP:MCP gateway: Przyjmuje zlecenie, przypisuje priorytet i dodaje do kolejki zadań asynchronicznych.Accepts the request, assigns priority, and queues it for async processing.
04
TTS: Moduł syntezy mowy generuje plik audio z tekstu narracji (VibeVoice lub edge-tts).Speech synthesis module generates an audio file from narration text (VibeVoice or edge-tts).
05
Media:Media: Opacjonalnie: obraz (FLUX.2), klip wideo (Wan2.2) lub grafika z archiwum.Optionally: image (FLUX.2), video clip (Wan2.2), or artwork from the archive.
06
Kompozycja:Composition: Silnik HyperFrames tworzy animowaną kompozycję HTML z GSAP — sceny, przejścia, napisy, efekty wizualne.HyperFrames engine builds an animated HTML composition with GSAP — scenes, transitions, captions, visual effects.
07
Muzyka:Music: Proceduralny podkład generowany przez Web Audio API, dołączany do ścieżki audio.Procedural soundtrack generated by the Web Audio API, attached to the audio track.
08
Render:Render: Chromium renderuje kompozycję do MP4 z wieloma workerami. Wynik trafia do katalogu projektu i archiwum.Chromium renders the composition to MP4 with multiple workers. The result lands in the project directory and archive.
09
Gotowe:Done: Gotowy plik wideo widoczny w Open Design — gotowy do udostępnienia lub dalszej obróbki.The finished video is available in Open Design — ready to share or further process.

OpenDesign MCP Pipeline to w pełni lokalne środowisko do produkcji treści audio-wideo z wykorzystaniem AI. Kluczowe cechy:

● Własna infrastruktura — pełna kontrola nad danymi i procesami
● Modularna architektura — każdy komponent można rozwijać niezależnie
● Otwarte standardy — komunikacja przez MCP (Model Context Protocol)
● Wszechstronność — od prostego TTS po złożone produkcje wideo z muzyką
● Powtarzalność — deterministyczny render gwarantujący identyczne wyniki

OpenDesign MCP Pipeline is a fully local environment for AI-powered audio-video content production. Key features:

● Own infrastructure — full control over data and processes
● Modular architecture — each component can be developed independently
● Open standards — communication via MCP (Model Context Protocol)
● Versatility — from simple TTS to complex video productions with music
● Reproducibility — deterministic rendering guaranteeing identical results

Roadmapa
Roadmap
Q2 2026 zrealizowane
Q2 2026 done
MCP Gateway + TTS (edge-tts + VibeVoice) + archiwum mediów (search-first) + generowanie obrazów FLUX.2.
MCP Gateway + TTS (edge-tts + VibeVoice) + media archive (search-first) + FLUX.2 image generation.
Q3 2026 w trakcie
Q3 2026 ongoing
Wan2.2 text-to-video w pipeline'u + pełny cykl wideo: tekst → TTS → kompozycja → render MP4.
Wan2.2 text-to-video in the pipeline + full video cycle: text → TTS → composition → MP4 render.
Q4 2026 wizja
Q4 2026 vision
Automatyzacja: uruchamianie zadań na podstawie list, baz danych lub Google Sheets. Autopublikowanie w mediach społecznościowych i innych destynacjach.
Automation: task execution driven by lists, databases, or Google Sheets. Auto-publishing to designated social media platforms and other destinations.
Pipeline łączy w sobie najnowsze osiągnięcia w dziedzinie syntezy mowy, generowania wideo, animacji komputerowych i proceduralnej produkcji muzyki — wszystko w ramach jednego, spójnego systemu. The pipeline combines the latest advances in speech synthesis, video generation, computer animation, and procedural music production — all within one cohesive system.