Doel, basismodel, LoRA: stapsgewijze leerproces wanneer politieke kapitaal geen prijsgeschiedenis heeft

geplaatst in: Uncategorized | 0

Algemene taalmodellen zijn verbluffend goed in proza en code. Ze zijn ook, in een diepe zin, doelloos. Geen enkele trainingsronde gaf hen ooit een permanente functiebeschrijving zoals “geld verdienen zonder te laten ontploffen.” Ze voorspellen het volgende token. Mensen leveren doelen in de prompt; de gewichten houden geen score bij na het einde van de chat.

Dat is prima voor een code-agent. Het is een structurele kloof als je machines wilt die beter worden in politiek kapitaal verhandelen op de manier waarop institutionele bureaus beter werden in het verhandelen van obligaties en aandelen. Decennia van prijzen, volumes en bedrijfsacties trainen financiële modellen. Voor politici hebben we dat niet. We weten niet wat de reële waarde is van een ambtsdrager. Daarom bouwde de 3DN-familie PolitiCap en marktkapitalisatie-stijlontdekking in de eerste plaats: een burgerlijke markt waar dibs (virtuele credits) en continue koersprijzen een openbaar gokgedeelte dwingen—en dat gokgedeelte bijwerken zodra nieuws binnenkomt.

Dit artikel is geen groeihhack voor PolitiCap-verkeer. Het is een AI-architectuur-opmerking: wat zou parallel kunnen zitten met de burgerlijke markt zodat schaarse, ruisachtige politieke-kapitaalgegevens nog steeds een model kunnen leren om winsten te maximaliseren in de loop van de tijd—zonder te doen alsof we al een geschiedenisboek van hedgefondsen hebben.

Het eerlijke probleem

Drie feiten botsen:

  1. Chat LLMs leren niet incrementeel van live beloning. Een gesprek bijwerkt geen gewichten. Compactie en lange sessies houden context bij; ze trainen niet.
  2. Keyword- en regelhandelaren leren ook niet. Een handmatig samengesteld lexicon dat “rechtszaak” in verband brengt met verkopen is bevroren menselijke intuïtie met een DeepSeek- of Grok-naambordje op de rekening.
  3. Klassieke markt ML gaat uit van een dichte geschiedenis. Versterkingsleren en begeleide retourmodellen eten miljoenen balken. Politiek-kapitaalmarkten zijn dun, jong en deels synthetisch. Beloning is schaars. Regimeverschuivingen zijn het product, niet de uitzondering.

Dus de droom van “volledige incrementele leer op elk gewicht, online, voor altijd” is echt grensverkennend onderzoek—en gemakkelijk om verkeerd te begrijpen (catastrofale vergeten, onveilige updates, stil overfitting naar één gelukkige week). De nuttige vraag is nauwer: welk ontwerp is nu bouwbaar dat nog steeds een permanent doel respecteert en competentie laat groeien naarmate gegevens binnensijpelen?

Ontwerpthese: bevroren basis + doelkop + inschuifbare LoRAs

Het werkbare patroon is niet “één gigantisch model dat een handelaar wordt.” Het is een kleine stapel:

  • Een basis taalmodel dat al Engels (en idealiter later Nederlands) kent, bevroren voor stabiliteit.
  • Een expliciete doelstelling: het maximaliseren van risico-gecorrigeerde winsten in dibs op het burgerlijk gebied—niet “verstandig klinken over politiek.”
  • LoRA-adapters (Low-Rank Adaptation) als hot-swapbare vaardigheidskaarten: dunne trainbare lagen die je aansluit op de basis zonder het hele brein te herschrijven.
  • Een ervaringsboekhouding die staat, actie en gerealiseerde beloning registreert wanneer de markt een vulling of een mark-to-market-beweging produceert.
  • Een offline trainingslus op lokale GPU-berekening die boekhoudingsrijen omzet in bijgewerkte LoRA’s op een schema.

Inferentie blijft saai en veilig: basis + actieve LoRA’s + harde risicobegrenzers (positielimieten, stopbestanden, vergoedingbewust dimensioneren). Training mag slim zijn; productie-uitvoering niet.

┌─────────────────────────────────────────────────────────┐
│ ERVARINGSBOEKHOUDING (staat, actie, beloning, kenmerken) │
│ burgerlijk gebied · nieuwsgebeurtenissen · portefeuillemarkeringen · sim-rollen │
└────────────────────────────┬────────────────────────────┘
│ offline batches

┌─────────────────────────────────────────────────────────┐
│ TRAIN (GPU)

De basis is niet de handelaar. Het is het gedeelde taalkundige substraat. Je bevriest het zodat elk LoRA-experiment begint vanuit dezelfde bekende Engelse competentie. Dat is het tegenovergestelde van het laten doen alsof een grenschatmodel de identiteit van een andere verkoper in een browsertab imiteert: de basisidentiteit is een bestand op de schijf met een hash, geen marketingstring.

Laag 2 — Doel: winsten maximaliseren (met tanden)

“Winsten maximaliseren” is onvolledig totdat je de score schrijft. Een productiedoel ziet er meer zo uit:

  • Primair: verandering in eigen vermogen (cash + mark-to-market bezittingen) in dibs.
  • Boetes: drawdown, omzet, kosten, concentratie in één ticker, korte voorraad als shorts zijn toegestaan.
  • Horizon: beloning wordt toegekend bij het invullen en opnieuw bij horizonmarkeringen (uren/dagen), niet alleen bij het klikken op kopen.

Die score is wat APG-stijl bureaus al in hun botten hebben: machines verslaan mensen wanneer het scorebord duidelijk is en de lus gesloten. Chatmodellen voelen slim omdat het scorebord is “vond de gebruiker de paragraaf leuk.” Verschillend spel.

Implementeer het doel op twee manieren die elkaar versterken:

  1. Prompt/systeemdoel bij inferentie: elke beslissingsoproep herformuleert het doel en de risicolimieten.
  2. Trainingsdoel offline: LoRA-updates maximaliseren de grootboek score, niet alleen de waarschijnlijkheid van de volgende token. Voorkeuren of beleidsgradiënten over (kop, boek, actie) → latere eigenvermogensdelta zijn genoeg om te beginnen; volledige deep RL kan wachten tot het grootboek dik is.

Laag 3 — LoRA-plug-ins (het incrementele deel)

LoRA is hoe je “incrementeel leren” krijgt zonder de oceaan te koken. Elke adapter is een klein matrixpaar dat in aandacht/MLP-blokken wordt geïnjecteerd. Je kunt:

  • Alleen de adapter trainen terwijl de basis bevroren blijft (stabiel Engels, lagere catastrofale vergeten).
  • Versie en rol terug adapters zoals softwarepakketten (news-v3, risk-v1).
  • Stapel of verwissel domein kaarten: politiek nieuws lezen, liquiditeitsreactie, Nederlandse vs EN koppen, later TH/ZH als het gezin ze nodig heeft.
  • A/B op papier voordat er enig live dibs risico is.

Voorgestelde eerste adapters:

Adapter Input Output / taak
lora-news-side kop + symbool + laatste + positie kopen / verkopen / overslaan + vertrouwen + korte onderbouwing
lora-size-risk vertrouwen + boek + vergoeding + caps hoeveelheid binnen harde klemmen (of een multiplier die de klemmen nog bezitten)
lora-regime recente vol, breedte, evenement tags risk-on / risk-off voorafgaand aan die de grootte beïnvloedt, niet de identiteit

Naarmate gegevens binnenkomen—PolitiCap vult, markeert, nieuws-ids—hertrain je de hete adapter vaker dan de koude. Dat is incrementeel leren in de zin van engineering: competentie groeit in dunne lagen terwijl de basis op zijn plaats blijft.

Laag 4 — Ervaringsboekhouding (omdat we geen decennia aan gegevens hebben)

Zonder een boekhouding ben je nog steeds aan het gokken. Met een boekhouding wordt elke transactie een begeleide of voorkeursrij:

  • Toestand: symbool, laatste, verhandelbaar vlagje, positie, cash, eigen vermogen, vergoedingstarief, thesishypothese vooraf, nieuws-id/url, eenvoudige tapekenmerken (volume delta, aantal afdrukken).
  • Actie: kant, hoeveelheid, besluitvormingsengine (zoekwoord / model / lora-versie), onderbouwingtekst.
  • Beloning: directe vullingseconomie + markering naar de markt over vaste horizonten + boetes.

In het begin zal de boekhouding schaars zijn. Dat wordt verwacht. Twee mitigaties die geen trucs zijn:

  1. Simulatie: speel historische nieuwsberichten af tegen een papieren boek; log nog steeds hetzelfde schema.
  2. Menselijke voorkeursparen: de balie labelt “dit nieuwsbericht had niet de maximale grootte moeten hebben” — klein maar hoog signaal voor LoRA.

De burgermarkt blijft de grondwaarheid wanneer live; simulatie zorgt alleen voor een bootstrapdichtheid. De taak van PolitiCap is om de waarde van politici waarneembaar te maken. De taak van de boekhouding is om die waarneembaarheid trainbaar te maken.

Laag 5 — Buitenste trainingslus, binnenste acteerlus

Train niet op het hete pad. Gescheiden klokken:

  • Binnen (seconden–minuten): nieuws en quotes ophalen, basis+LoRA-inferentie uitvoeren, klemmen, uitvoeren of droogdraaien, boekhouding toevoegen.
  • Buiten (uren–dagen): boekhouding in batch → GPU-taak → nieuw LoRA-artefact → evalueren op gereserveerde dagen → promoten of weggooien.

Die splitsing komt overeen met hoe serieuze AI-engineering al codeeragenten en inferentiefarms uitvoert: sessiecontinuïteit en promptcache op het interactieve pad; zwaardere training offline op multi-GPU-boxen wanneer de batch klaar is. De kosten van tokens blijven bij de inferentie; de trainingskosten blijven bij geplande taken die je kunt meten.

Wat dit niet is

  • Geen voorspellingsmarkt. PolitiCap is een politieke-kapitaal-/burgermarkt met continue tickertape en dibs—geen binaire 'wint X het?'-contracten.
  • Niet 'het chatmodel is het fonds.' Chat is een programmeur en criticus. De handelaar is een geversionde stack met een grootboek.
  • Geen gegarandeerde alpha. Dunne markten overfitten. Adapters kunnen één Battle-of-the-AIs-week onthouden. Risicoklemmen en stopswitches maken deel uit van de architectuur, geen optionele moraal.
  • Geen volledige online backprop door de basis. Als je uiteindelijk diepere updates nodig hebt, doe ze dan als zeldzame basis-updates met eval-poorten—niet als elke vulling de basis muteert.

Waarom dit nog steeds belangrijk kan zijn

Als de enige systemen die 'handel leren' dertig jaar vloeibare tape nodig hebben, blijft politieke kapitaal voor altijd een schatting. Een LoRA-aansluitbare, doelgeconditioneerde stack verlaagt de databar: je bedenkt een markt zodat waarde kan worden ontdekt, je logt elke ontdekking, en je laat dunne adapters de scorebord beklimmen terwijl Engels (en later andere talen) bevroren en controleerbaar blijven.

Dat is het parallelle spoor: PolitiCap als het instrument; de doel-basis-LoRA-stack als de leerling; DutchBud als de fintech-ruggengraat waar virtuele tegoeden, digitaal portemonneegedrag en geld in gesloten lus al in de 3DN-familie leven. Open banking en neobank-verhalen zijn hoe buitenstaanders de bank vinden; de burgertape is hoe politieke kapitaal een getal wordt dat een machine kan optimaliseren.

Frontier continu leren zal blijven bewegen. Je hoeft niet te wachten om te beginnen. Je hebt een basis nodig die spreekt, een doel dat scoort, adapters die aansluiten, een grootboek dat nooit liegt over winst en verlies, en genoeg GPU-berekeningen om opnieuw te trainen wanneer de lekkage van gegevens een nieuwe kaart in het chassis rechtvaardigt.

3DN — berekenen, agenten en de familie-stack achter werk · geld · politiek. Architectuur eerst; scorebord tweede; hype nooit.

Geef een reactie

Je e-mailadres wordt niet gepubliceerd. Vereiste velden zijn gemarkeerd met *