通用语言模型在散文和代码方面令人惊讶。它们在某种意义上也是没有目标的。没有一次训练运行赋予它们一个永久的工作描述,比如“不爆炸地赚钱。”它们预测下一个标记。人类在提示中提供目标;聊天结束后,权重不记分。
对于编码代理来说,这很好。如果你想要机器像机构交易台改善债券和股票交易那样改善交易政治资本,这是一个结构性差距。几十年的价格、交易量和公司行动训练金融模型。对于政治家,我们没有那盘磁带。我们不知道公职人员的公允价值。这就是为什么3DN家族首先构建了PolitiCap和市值风格发现:一个公民市场,其中dibs(虚拟信用)和连续的交易价格迫使公众猜测—并随着新闻发布更新这个猜测。
这篇文章不是PolitiCap流量的增长黑客。它是一篇AI架构说明:什么可以与公民市场并行存在,以便稀疏、嘈杂的政治资本数据仍然可以教模型随着时间的推移最大化收益—而不假装我们已经有了一个对冲基金历史书。
诚实的难题
三个事实相撞:
- 聊天LLM不会从实时奖励中逐步学习。对话不会更新权重。压缩和长时间会话保持上下文;它们不会训练。
- 关键词和规则交易者也不会学习。一个手工策划的词典,将“诉讼”映射为销售,是冻结的人类直觉,带有DeepSeek或Grok的名牌。
- 经典市场ML假设密集的历史。强化学习和监督回报模型消耗数百万条。政治资本市场稀薄、年轻、部分合成。奖励稀疏。政权转变是产品,不是例外。
所以,“在线、永远对每个权重的完整增量学习”的梦想是真正的前沿研究—而且很容易出错(灾难性遗忘、不安全的更新、对一个幸运周期的无声过拟合)。有用的问题更窄:现在可以构建什么设计仍然尊重永久目标,并随着数据渗入让能力增长?
设计论文:冻结基础+目标头部+可插拔LoRA
可行的模式不是“一个成为交易员的巨型模型。”它是一个小堆栈:
- 一个基础语言模型已经知道英语(理想情况下后来是荷兰语),冻结以确保稳定。
- 明确的目标:最大化在 civic tape 上的风险调整收益,而不是“对政治有深刻见解。”
- LoRA 适配器(低秩适应)作为热插拔技能卡:你可以将这些薄的可训练层插入到基础模型中,而无需重写整个大脑。
- 一个经验账本,记录市场产生填补或市值变动时,状态、操作和实现奖励。
- 一个离线训练循环,在本地 GPU 计算上,按计划将账本行转换为更新的 LoRA。
推理保持无聊和安全:基础 + 活动 LoRA + 严格风险夹具(头寸上限、停止文件、费率感知尺寸)。训练被允许聪明;生产执行不被允许。
┌─────────────────────────────────────────────────────────┐
│ EXPERIENCE LEDGER (状态、操作、奖励、特征) │
│ civic tape · 新闻事件 · 投资组合标记 · 模拟滚动 │
└────────────────────────────┬────────────────────────────┘
│ 离线批次
▼
┌─────────────────────────────────────────────────────────┐
│ TRAIN (GPU) │
│ loss ≈ −gain + λ·risk + μ·turnover │
│ 更新 LoRA_A (news→side) · LoRA_B (size/risk) · … │
│ 基础权重 FROZEN │
└────────────────────────────┬────────────────────────────┘
│ 发布适配器版本
▼
┌─────────────────────────────────────────────────────────┐
│ INFERENCE AGENT │
│ 基础 LM (EN) + LoRA 堆栈 + 目标提示/头部 │
│ → {side, confidence, rationale} │
│ → risk clamps → broker execute → log reward │
└─────────────────────────────────────────────────────────┘
第 1 层 — 基础模型(英语,小,主权)
选择一个 3B–14B 类别的开放权重指令模型,你可以在自己的 GPU 基础设施上运行和微调。要求:
- 英语足够强大,可以阅读标题并发出严格的 JSON 决策。
- 足够小,LoRA 训练可以在一夜之间完成,而不是下个季度。
- 可以在你的数字主权约束下运行——你持有的权重,你计量推理,关键路径上没有无声供应商的细小字体。
基础不是交易者。它是共享的语言基础。你将其冻结,以便每个 LoRA 实验都从相同的已知英语能力开始。这与让一个前沿聊天模型在浏览器标签页中扮演不同的供应商身份相反:基础身份是一个带有哈希的文件,而不是营销字符串。
第 2 层 – 目标:最大化收益(有牙齿)
在写出分数之前,“最大化收益”是不完整的。生产目标看起来更像这样:
- 主要:dibs 中的股权变化(现金 + 市值持仓)。
- 罚款:回撤、周转率、费用拖累、一个代码的集中度、如果允许做空则为空头库存。
- 期限:奖励在填补时记入,并在期限标记(小时/天)时再次记入,而不仅仅是在点击购买时。
这个分数是 APG 风格的办公桌已经深知:当记分板清晰且循环关闭时,机器会击败人类。聊天模型之所以感觉聪明是因为记分板是“用户是否喜欢这个段落”。不同的游戏。
以两种相互加强的方式实现目标:
- 提示/系统目标在推理中:每个决策调用都重申目标和风险限制。
- 训练目标离线:LoRA 更新最大化账本分数,而不仅仅是下一个令牌的可能性。偏好或策略梯度(标题、书籍、行动)→ 以后的股权变化足以开始;完整的深度 RL 可以等到账本变厚。
第 3 层 – LoRA 插件(增量部分)
LoRA 是如何在不沸腾海洋的情况下实现“增量学习”的方法。每个适配器都是注入到注意力/MLP 块中的一个小矩阵对。你可以:
- 只训练适配器,而基础保持冻结(稳定的英语,较低的灾难性遗忘)。
- 版本和回滚适配器,如软件包(
news-v3,risk-v1)。 - 堆叠或交换领域卡:阅读政治新闻、流动性反应、荷兰语 vs 英文标题,如果家庭需要,则为 TH/ZH。
- 在纸上 A/B 测试,在任何实际 dibs 风险之前。
建议的第一个适配器:
| 适配器 | 输入 | 输出/任务 |
|---|---|---|
lora-news-side |
标题 + 符号 + 最新 + 位置 | 买入/卖出/跳过 + 置信度 + 短评 |
lora-size-risk |
置信度 + 账簿 + 手续费 + 封顶 | 在硬夹具内(或夹具仍拥有的倍数) |
lora-regime |
近期波动率、广度、事件标签 | 风险偏好/风险规避优先考虑规模,而不是身份 |
随着数据的渗透——PolitiCap 填充、标记、新闻 ID——你比冷适配器更频繁地重新训练热适配器。这 是 工程意义上的增量学习:能力以薄层增长,而基础保持不变。
第 4 层 — 经验账本(因为我们没有几十年的数据)
没有账本,你仍然在猜测。有了账本,每次交易都成为监督或偏好行:
- 状态: 符号、最新、可交易标志、位置、现金、股权、手续费率、之前论点、新闻 ID/URL、简单胶带特征(成交量变化、印刷次数)
- 操作: 侧面、数量、决策引擎(关键词/模型/lora-版本)、理由文本
- 奖励: 即时填充经济学 + 固定期限的市价 + 罚款
早期账本将是稀疏的。这是预期的。两种不是作弊的缓解措施:
- 模拟: 将历史新闻与纸质书重播;仍然记录相同的模式
- 人为偏好对: 办公桌标签“这个标题不应该最大化规模”——对 LoRA 来说,小但信号高
在实时情况下,公民市场仍然是基准事实;模拟只是引导密度。PolitiCap 的任务是使政治家价值 可观察。账本的任务是使这种可观察性 可训练。
第 5 层 — 外层训练循环,内层行动循环
不要在热路径上训练。分开的时钟:
- 内层(秒到分钟): 获取新闻和报价,运行 base+LoRA 推断,夹紧,执行或干运行,追加账本
- 外层(小时到天): 批处理账本 → GPU 任务 → 新 LoRA 伪像 → 在保留日评估 → 晋升或丢弃
这种划分与严肃的 AI 工程已经运行的编码代理和推理农场相匹配:交互路径上的会话连续性和提示缓存;当批处理准备就绪时,在多 GPU 计算机上进行更重的离线训练。代币成本保持在推理上;训练成本保持在你可以计量的计划任务上。
这不是什么
- 不是预测市场。 PolitiCap 是一个具有连续代码和 dibs 的政治资本/公民市场,而不是二进制的“X 会赢吗?”合同。
- 不是“聊天模型就是基金”。 聊天者是编码者和评论家。交易者是一个版本化的堆栈,带有分类账。
- 没有保证的阿尔法。 薄市场过拟合。适配器可以记住一个 AI 对战周。风险夹和停止开关是架构的一部分,不是可选的道德。
- 不是通过底层进行全面的在线反向传播。 如果你最终需要更深入的更新,将其作为罕见的底层刷新,使用 eval 门槛,而不是每次填充都改变基础。
为什么这仍然可能重要
如果“学习交易”的系统需要三十年的流动代码,政治资本将永远是一个估计值。可插拔、目标条件的堆栈降低了数据门槛:你发明一个市场,以便发现价值,你记录每次发现,你让薄适配器爬上记分板,而英语(以及后来其他语言)保持冻结和可检查。
这是并行轨道:PolitiCap 作为乐器;目标-基础-LoRA 堆栈作为学习者;DutchBud 作为金融科技脊柱,虚拟信用、数字钱包行为和闭环分类账货币已经在 3DN 家族中存在。开放银行和新银行叙事是外部人找到银行的方式;公民代码是政治资本如何成为机器可以优化的数字。
前沿持续学习将继续前进。你不必等待它开始。你需要一个会说话的基础、一个得分的目标、可以插拔的适配器、一个关于损益从不撒谎的分类账,以及足够的 GPU 计算能力,以便在数据渗漏证明有必要在机箱中添加另一张卡时进行重新训练。
3DN — 计算、代理和工作背后的家族堆栈 · 金钱 · 政治。架构第一;记分板第二;炒作永远不会。
发表回复