Schlüsselergebnis: Vollständig automatisierter Multi-Agenten-Arbeitsbereich mit persistentem FTS5-Speicher, 21 benutzerdefinierten Skills und 24 aktiven Cron-Orchestrierungsjobs
Zusammenfassung: Entwicklung und Bereitstellung eines autonomen Multi-Agenten-Netzwerks, das auf einem dedizierten Google Cloud VPS ausgeführt wird. Das System dient als einheitlicher digitaler Executor, der die Kommunikation über mehrere Chat-Gateways (Telegram, Discord, WhatsApp, E-Mail) in einen einzigen, Obsidian-gestützten kognitiven Kern mit persistentem sitzungsübergreifendem Speicher leitet. Darüber hinaus ist Oz so konfiguriert, dass es direkt mit meinem Projekt Hermes Agent kommuniziert, um verteilte Workflows zu koordinieren.
Das Problem
Herausforderung:
Fragmentierung über mehrere Kanäle: Verwaltung unzusammenhängender Informationsströme über mehrere Kommunikationskanäle.
Autonome Hochgeschwindigkeits-Ausführung: Notwendigkeit einer kontinuierlichen, geplanten Ausführung von Backups, E-Mails, System-Updates und Vault-Audits.
Sitzungsamnesie: Traditionellen LLM-Agenten fehlt ein persistenter Speicher, was die Kontinuität über mehrere Interaktionen über Tage oder Wochen hinweg beeinträchtigt.
Obsidian Vault Komplexität: Aufrechterhaltung der strukturellen Konsistenz, der Schemaformate und des Notizen-Routings für einen Obsidian-Vault mit über 230 Dateien.
Sicherheitsrisiken: Hohes Bedrohungsprofil durch öffentliche Messaging-Gateways, was eine strikte Prompt-Injection-Abwehr und Zugriffskontrollen erfordert.
Zielgruppe: Persönlicher Produktivitäts-Arbeitsbereich, Wissensdatenbank-Assistent und automatisierter Systemoperator.
Einschränkungen:
Suchmaschinen-API-Einschränkungen: Keine Such-API-Schlüssel erlaubt, was ein Fallback auf eine benutzerdefinierte Scraping-Abstraktionsschicht für mehrere Suchmaschinen erzwingt.
VPS-Limits: Bereitgestellt auf einem 4-vCPU / 15GB RAM Google Cloud VPS ohne Swap, was eine sorgfältige Speicherverwaltung erfordert.
Authentifizierungs-Blockaden: Alle GitHub-Operationen sind aufgrund nicht authentifizierter Client-Umgebungen auf SSH-Schlüssel-Authentifizierung beschränkt.
Datenspeicherung: Beschränkt auf lokale flache Dateien (Markdown, JSON, SQLite) anstelle von verteilten externen Datenbanken.
Ansatz & Entscheidungen
Architektur: Ein zentralisiertes Dispatcher-Muster, bei dem Oz als primärer Orchestrator fungiert und eingehende Aufgaben je nach Komplexität dynamisch an spezialisierte, rollenbasierte Sub-Agenten weiterleitet.
Wichtige Entscheidungen:
Claude-Mem-Integration: Implementierung einer SQLite + FTS5-Datenbank zur automatischen Injektion von sitzungsübergreifendem Kontext in active Läufe.
Obsidian-First-Speicherung: Entscheidung für flache Markdown-Dateien zur einfachen Visualisierung, Portabilität und manuellen Graphenanalyse.
Multi-Modell-Fallback-Kette: Einrichtung von DeepSeek V4 Flash als kostengünstiges Arbeitspferd mit Fallback-Routen zu Google Gemini- und Grok-Modellen, um die Betriebszeit zu sichern.
Kompromisse:
Polling vs. Webhooks: Cron-basierte E-Mail-Überprüfung und Keepalives gewählt (kostenlos und ohne Konfiguration im OpenClaw-Gateway), was jedoch eine Latenz von bis zu 8 Stunden bei der E-Mail-Überprüfung einführte.
Flache Markdown-Wissensdatenbank: Markdown und SQLite erfordern weniger Infrastrukturverwaltung, schränken jedoch Echtzeit-Multi-Node-Abfrageaggregationen im Vergleich zu vollwertigen Vektordatenbanken ein.
Schlüsselergebnisse & Auswirkung
Ergebnis: Erfolgreicher Betrieb eines autonomen Executors, der tägliche Autocommits, E-Mail-Verarbeitung, Hintergrundautomatisierung und Notizenarchive verwaltet.
Vergleich: Ersetzung von manuell aktualisierten Journalen, komplexem Scraping über mehrere Apps und getrennten Chats durch einen einzigen, persistenten und intelligenten Arbeitsbereich-Assistenten.
Auswirkung: Erreichung robuster automatisierter Abläufe mit Fallback-Funktionen, die einen kontinuierlichen Service auch bei Ausfällen des Primärmodells garantieren.
Benutzerdefinierte Plugins und Automatisierungsskripte
Serverressourcen
4 vCPUs / 15GB RAM
Google Cloud VPS (Ubuntu 22.04 LTS)
RAM-Nutzung
~1.8GB / 15GB
Durchschnittlicher Idle-Speicherbedarf
Antwortlatenz
1 - 3 Sekunden
Hot-Cache DeepSeek (bis zu 15s bei Kaltstarts von Multi-Agenten)
Aktive Gateways
Telegram, Discord, WhatsApp
Erwähnungen, offene DMs und Broadcast-Gruppen
Technische Vertiefung
Besondere Details:
imap-smtp-email: Integriert iCloud-SMTP mit obligatorischem CC-Ketten-Routing (oz@franzdomingo.dev → CC-Liste), ausgeführt über Node.js-Hilfsskripte.
multi-search-engine: Aggregiert 16 Suchmaschinen (global und regional) ohne aktive API-Schlüssel zu benötigen.
self-improving-agent: Unterstützt die Lernpersistenz, indem Erfahrungen direkt in einem .learnings/-Verzeichnis gespeichert werden, um zukünftige Ausführungsparameter zu formen.
prompt-injection-guard: Echtzeit-Nachrichtenklassifizierung, Passwort-Hash-Validierung und Spoofing-Erkennung.
Verifizierung: Überwacht durch isolierte und sitzungsgebundene Agenten-Durchläufe, automatisierte Git-Commits und regelmäßige Telegram-Log-Übertragungen.
Optimierungen: Implementierung von kostenbewusstem Routing, bei dem einfache Aufgaben an Budgetmodelle gesendet werden, während Premium-Reasoning-Modelle für mehrstufige Denkprozesse reserviert bleiben.
Reflexionen
Was ich anders machen würde: Ich würde untersuchen, einige der Polling-Aktionen auf Webhook-Integrationen zu migrieren, um eine geringere Latenz bei Eingaben (wie E-Mail-Updates) zu erzielen, anstatt mich ausschließlich auf geplantes Polling zu verlassen.
Erfolge: Das zentralisierte Dispatcher-Muster erwies sich als äußerst zuverlässig und isolierte spezialisierte Workflows (Prosa, Retrieval, Code) in dedizierten, sauberen Sub-Agenten-Umgebungen.
Lehren: Flache Dateistrukturen sind außergewöhnlich portabel und effizient bei mittlerer Skalierung (~200+ Notizen). Wenn sich der Vault jedoch 1.000+ Notizen nähert, erfordern Indizierung und Abruf eine Migration zu einem strukturierten Datenbank-Caching.
Meine Beiträge
Systemarchitektur & Bereitstellung: Konfiguration und Bereitstellung der Node.js/OpenClaw-Laufzeitumgebung auf Google Cloud, Verwaltung von SSH-Zugriffskonfigurationen, VPS-Prozessverwaltung und benutzerdefinierten systemd-Bindings.
Skill-Engineering: Entwicklung der Arbeitsbereichs-Bibliothek mit 21 Skills von Grund auf, Implementierung von iCloud-E-Mail-Relays, schlüssellosen Such-Scrapern, PDF-Dienstprogrammen und Speicherinjektionsdatenbanken.
Sicherheits- & Integritätsdesign: Aufbau des Prompt-Injection-Guard-Subsystems zur Gewährleistung der Zugriffssicherheit über exponierte öffentliche Endpunkte (Telegram-Bot, Discord-Server).
Automatisierungs-Pipeline-Design: Einrichtung des Cron-Runner-Schedulers für 24 Jobs zur Ausführung täglicher Backups, Code-Synchronisationen und System-Heartbeats.
Projektarchitektur
Das System verwendet ein zentralisiertes Dispatcher-Muster, um Eingaben über drei primäre operative Schichten zu leiten und auszuführen:
Schicht
Komponenten
Rolle & Datenfluss
Ingress-Gateways
Telegram, Discord, WhatsApp, WebChat
Dient als Benutzeroberfläche, empfängt Anfragen und formatiert kanalgerechte Antworten.
Zentrales Routing
Oz Hauptagent (Dispatcher)
Bewertet die Komplexität der Payload, bestimmt die Dispatch-Kaskade und verwaltet den Lebenszyklus der Worker-Agenten.
Ausführungspool
15+ spezialisierte Sub-Agenten
Führt benutzerdefinierte Arbeitsbereich-Aufgaben aus (Retrieval, Scripting, Ausführung, Sicherheit).
Oz Hauptdispatcher — Einziger Entscheidungspunkt. Bewertet die Komplexität der eingehenden Payload (einfach=0 Dispatch, komplex=1-2, ultra=5+) und delegiert an den richtigen Spezialisten. Hält Tiefenbegrenzungen ein: nicht mehr als 5 aufeinanderfolgende Tool-Aufrufe ohne Rücksprache mit dem Benutzer.
Vault-Triade — Drei spezialisierte Agenten verwalten den Lebenszyklus des Obsidian-Vaults:
Librarian (Bibliothekar) — Besitzt den Vault-Index sowie die Such- und Abruf-Pipelines. Wird von Oz nie direkt gegoogelt oder gegreppt; Librarian bestätigt Pfade, dann übernimmt Oz die Ausgabe. Führt einen eigenen täglichen Archivierungs-Cron aus.
Writer (Schreiber) — Spezialisiert auf die Formatierung von Prosa, Berichten und Dokumentationsdateien. Geschult in Hemingway, Orwell, Strunk & White, King. Kümmert sich um Grammatik, Registerauswahl und das Prinzip "Zeigen, nicht beschreiben". Erstellt alle im Vault geschriebenen Inhalte.
Keeper (Hüter) — Verwaltet Metadaten-Vorlagen, Frontmatter-Compliance und die Archivierung veralteter Notizen. Führt alle 3 Tage einen Wartungs-Cron aus. Erzwingt eine hochgradig skalierbare Vault-Struktur über Notizen und Verzeichnisse hinweg.
Claude-Mem-Engine — Verbindet sich direkt mit der lokalen SQLite-Datenbank (FTS5, systemd-gesteuert), ruft Such-Embeddings ab und injiziert sitzungsübergreifenden Verlauf in LLM-Prompts. Zwischengespeicherte Kontextanfragen für 60s zur Vermeidung von Überlastung. Schutzschalter (circuit breaker): 3 aufeinanderfolgende Fehler = 30s Abkühlzeit. Ausgeschlossene Agenten (coder, math-solver, front-end-developer, multimedia-specialist) müssen den Endpunkt manuell über curl abfragen. Eine private Web-Benutzeroberfläche steht für das manuelle Durchsuchen bereit. Beachten Sie, dass dieser Mechanismus die Gesamt-Token-Nutzung erheblich reduziert.
Worker-Sub-Agenten-Pool (14 namentlich genannte Spezialisten + Oz) — Alle Agenten im Netzwerk haben Zugriff auf Claude Code, Gemini CLI und Antigravity, jeweils ausgestattet mit ihren entsprechenden integrierten Skills:
Hosting- & Betriebshinweis:
Oz wird aktiv auf der Google Cloud Platform gehostet und läuft lokal auf einem Entwickler-MacBook Air. Der zugrunde liegende Code und das Repository bleiben privat.