Aus einem Meer aus Informationen die Signale, die zählen

Der Backend-Kern unserer Arbeit: aus großen, unstrukturierten Informationsmengen — Nachrichten, Studien, Verordnungen, Tabellen — genau die relevanten Signale extrahieren und verdichten. Lokal berechnet, jederzeit nachvollziehbar, DSGVO-konform. So arbeiten unsere Pipelines.

Lokal berechnet Nachvollziehbar Datensouverän

Signale genug — nur verstreut

Organisationen sitzen bereits auf vielen Signalen — Markt, Kunden, Technologie, Regulatorik. Nur liegen sie verstreut in Berichten, Newslettern, Dokumenten und Gesprächen. Sie werden wahrgenommen, aber nicht systematisch bewertet, priorisiert oder in Entscheidungen überführt. Die Folge: Man reagiert, statt frühzeitig zu handeln.

Der Weg eines Signals

Vom Rohdokument zur strukturierten, durchsuchbaren Datenbank — in klar getrennten Schritten, jeder für sich prüfbar.

Ingestion → Lokales Modell → Zwei-Stufen-Tagging → Semantischer Abgleich

📥01

Erfassen

Nachrichten, PDFs, Studien, Verordnungen und Tabellen aus vielen Quellen einlesen.

🧩02

Normalisieren

In ein einheitliches Schema überführen; ein Content-Hash entfernt Dubletten.

🖥️03

Lokales Modell

Auf eigener Hardware entstehen strukturierte Ausgaben statt Fließtext: Zusammenfassung plus Tags für Thema, Zeit und Ort.

🎯04

Zwei-Stufen-Tagging

Erst grob in wenige Themengruppen, dann fein in deren Unterkategorien — der entscheidende Kniff.

🔗05

Semantischer Abgleich

Getroffen wird nach Bedeutung, nicht nach Schreibweise — über Sprachen hinweg (RAG).

Der entscheidende Kniff

Zwei einfache Fragen statt einer unmöglichen

Ein kleines lokales Modell wählt zuverlässig aus wenigen Optionen — nicht aus hunderten auf einmal. Also fragen wir zweimal einfach statt einmal unmöglich.

Stufe 1

Grobe Einordnung + Relevanz-Gate

Einordnung in 1–3 von wenigen übergeordneten Themengruppen, dazu eine Relevanz-Bewertung. Diese Bewertung wirkt als Rauschfilter: Unwichtiges fällt früh raus und spart Rechenzeit.

Stufe 2

Feine Auswahl

Nur innerhalb der gewählten Gruppen werden rund sechs passende Unterkategorien bestimmt — nie aus dem gesamten Katalog auf einmal.

Das Ergebnis: verlässlich strukturierte Ausgaben aus einem kleinen lokalen Modell — mit hoher Genauigkeit auf günstiger Hardware.

Bedeutung statt Stichwort

„E-Auto-Förderung" findet auch „Zuschuss für Elektrofahrzeuge" oder „EV purchase incentive" — über Sprachen hinweg. Die kuratierte, mehrsprachige Taxonomie sorgt für Konsistenz; ein Thema darf zugleich in mehreren Gruppen liegen.

Selbstlernend, überwacht

Noch nicht abgedeckte Themen werden automatisch erkannt; die Taxonomie wächst mit. Das System schlägt vor — ein Mensch prüft und entscheidet, was offiziell wird.

Lokal. Nachvollziehbar. Souverän.

Vier Prinzipien, die in jeder Pipeline gelten — nicht als Beiwerk, sondern eingebaut.

🧭

Mehrdimensionale Relevanz

Thema, Zeit, Ort und Bewertung zusammen — erst die Kombination filtert das Rauschen.

🧑‍⚖️

Der Mensch entscheidet

Das System verdichtet und priorisiert. Es entscheidet nie selbst; neue Taxonomie schlägt es vor, ein Mensch gibt sie frei.

🔍

Transparenz

Eine Begründung je Einordnung plus Link zur Originalquelle — jedes Ergebnis ist bis zur Quelle nachvollziehbar.

🛡️

Datensouveränität by Design

Betrieb auf EU-/deutschen Servern oder eigener Infrastruktur. Lokale Inferenz heißt: sensible Daten bleiben im Haus.

Zwei Pipelines, zwei Beweise

Dieselbe Denkweise — erfassen, verarbeiten, entscheidungsreif ausgeben — in zwei sehr unterschiedlichen Domänen.

Prototyp

Trend Lense

Regionales Signal-Radar für eine Regionalbank

🔭

Aus einer Flut globaler Nachrichten zu lokaler Klarheit.

Gebaut für die Volksbank Mittelhessen im Rahmen des StartMiUp-Hackathons „AI for Mittelhessen".

Die Bank hat Markt-, Kunden-, Regulatorik- und Regionalsignale längst — nur fragmentiert über Berichte, Newsletter und Gespräche. Ergebnis: reagieren statt agieren.

sammeln · bewerten · priorisieren · übersetzen

Eine Signal-Datenbank, gebaut für lokale Relevanz: die oben beschriebene Pipeline mit einer kuratierten Regional-Taxonomie.

16
Themengruppen
~98
Leaf-Tags (~6 je Gruppe)
~11.155
Artikel geladen & eingebettet

Anders als Google (SEO-getrieben, kein Datenschutz), ChatGPT (flache Websuche, halluzinationsanfällig, Kundendaten in den USA verarbeitet) und Blackbox-Anbietern wie Itonics oder Trendone (ab ~5.880 €/Jahr): einmalige Einrichtung, sehr geringe laufende Kosten, automatisiert und lokal, DSGVO-konform.

Der Prototyp nutzt ausschließlich öffentliche/offene Daten (GovData, data.europa.eu, GDELT u. a.) — keine echten Kundendaten.

Ehrlich eingeordnet: ein funktionierender Prototyp, kein fertiges Produkt. Offen sind noch der Novelty-Check, ein vollständiger Tagging-Lauf über den Gesamtkorpus und die MCP-Schnittstelle.
Live

Energy Oracle

Dispatch-Optimierer für Batteriespeicher am Day-Ahead-Strommarkt

🔋

Eine andere Art von Pipeline: numerisch, statistisch, deterministisch.

Optimiert den Einsatz von Batteriespeichern am deutschen Day-Ahead-Markt (DE-LU). Gleiche Grundidee — erfassen, deterministisch verarbeiten, entscheidungsreif ausgeben — aber ohne lokales LLM und ohne Taxonomie: hier zählen Physik, Preise und Statistik.

01
Batterie-Physikmodell

Fünf Zell-Chemien, als konkave affine Grenzen exportiert, damit der Einsatzplan ein lineares Programm bleibt.

02
Mehrquellen-Preis-Ingestion

SMARD, Energy-Charts, aWATTar, ENTSO-E und Ember — nach Quellenpriorität dedupliziert zu einer kanonischen Sicht; idempotent, negative Preise bleiben erhalten.

03
Arbitrage-LP je Tag

Ein lineares Programm bestimmt pro Tag den kostenoptimalen Lade- und Entladeplan.

04
Walk-forward-Backtest

Leckagefreies Forecasting: LEAR (LASSO-AR je Stunde), Gradient-Boosted Trees und deren Ensemble — gegen Benchmarks bis zur Perfect-Foresight-Obergrenze und einem simplen Timer.

Drei interaktive Dashboards: Spot-Preise, Batterie-Simulator und Forecast-Backtest.

Auf echten Daten (Haus-LFP, 10 kWh / 5 kW, 180 Tage) erreicht der Ensemble-Forecast rund 92 % des Optimums bei perfekter Voraussicht — ein selbst gemessenes Ergebnis aus dem Repository, kein auditierter Benchmark.

Stack: Python 3.11+, NumPy/SciPy/scikit-learn, reiner stdlib-HTTP-Server, ruff + mypy clean, 165 grüne Tests — vollständig deterministisch (feste Seeds, kein Netz zur Rechenzeit).

energy.neuralangels.de →

Push und Pull auf einer Datenbank

Dieselbe Signal-Datenbank, zwei Wege sie zu nutzen — jedes Ergebnis mit Quelle.

📡

Push — der Feed

Jedes Profil trägt gewichtete Tags; passende neue Signale fließen automatisch in einen personalisierten, filterbaren Feed.

💬

Pull — der Assistent

Eine Frage in natürlicher Sprache wird in Tags plus Zeit- und Ortfilter übersetzt und ruft die relevanten Einträge ab — die Datenbank ist die Faktenbasis.

Der Pipeline-Stack

Aus dem Arbeitsprototyp — für alle, die es genau wissen wollen.

BackendFastAPI · SQLAlchemy 2 · PostgreSQL/pgvector
Lokale Inferenzllama.cpp mit grammatik-gebundenem JSON · OpenAI-kompatibel, damit ein lokales Modell einspringen kann
Embeddingstext-embedding-3-small
RetrievalHybrid: Tag-Score ⊕ Dense (pgvector-Cosinus) ⊕ BM25/Deutsch-Volltext, fusioniert per gewichteter Reciprocal Rank Fusion
DeterminismusTemperatur 0

Ihr sitzt auf verstreuten Informationen?

Wir bauen die Pipeline, die daraus nutzbare Signale macht — zugeschnitten auf eure Quellen und Domäne.

Gespräch anfragen