LLM Proxy + 记忆注入

自动优化成本

Gateway 在 MemoryX 中统一接管 LLM 请求:自动注入长期记忆、利用模型厂商缓存、不同模型的价格、对话长度等选择最优策略,在不损失体验的前提下显著降低 token 消耗。

MemoryX Gateway
→ 记忆注入 system + context
→ 智能缓存 cache_control
→ 多模型 Anthropic / OpenAI / Z.AI …
✓ 请求已优化,成本节省约 70%+

Core Capabilities

记忆 + 多模型 + 成本优化,一站搞定

记忆注入

每次请求自动带上当前会话相关的长期记忆,无需重复说明偏好与背景,越聊越聪明。

system + 召回记忆 → 上下文完整

多模型统一

一套接口对接 Anthropic、OpenAI、Google、Z.AI 等,随时切换模型与厂商。

OpenAI · Anthropic · Gemini · GLM …

智能缓存

在支持缓存的厂商上自动利用提示词缓存,重复内容按缓存价计费。

缓存命中 省约 60%+ 输入成本

智能调度

多信号评分:根据任务复杂系数,自动调度后端低价模型,拉低平均 Token 单价。

任务简单 → 低价模型 · 复杂 → 高价模型

成本优化策略

根据厂商能力与对话长度自动选择最优策略:显式缓存、尾部控制或总结压缩,减少 token 消耗。

显式缓存 → 尾部控制 → 总结压缩

长对话压缩

历史过长时自动摘要旧内容并保留最近对话,既省 token 又保持上下文连贯。

长上下文
滚动摘要 + 最近对话

与 OpenClaw 等 Agent 配合使用

通过 MemoryX 插件即可启用网关与记忆,无需改业务代码。

查看完整 API 文档