Gwenlake API

一个兼容 OpenAI 的 API,涵盖对话、向量化、重排序和音频。我们在自主可控的基础设施上为您部署开源模型并负责运维:GPU、扩缩容、版本升级,您的应用始终只看到一个端点。

四种能力, 一个端点

一条检索链路需要的不只是一个对话模型。所需的一切都由同一个 API 提供,共用同一个密钥和同一份配额。

  • 对话与补全

    开源 LLM,支持流式输出、工具调用和结构化输出,采用您的库已经在用的 OpenAI 兼容格式。

  • 向量化

    用您选择的嵌入模型把文档和查询向量化,与其余能力运行在同一套自主可控的基础设施上。

  • 重排序

    按真实相关性重新排列检索到的段落,正是这一步把平庸的 RAG 链路变成可用的链路。

  • 音频

    转写通话、会议和录音,它们承载的知识不比您的文档少。

链路中 没有第三方

私有推理不是我们勾上的一个选项,而是这项服务存在的理由。

  • 开放权重模型

    部署并运维在自主可控的基础设施上。

  • 专属端点

    按组织和按项目相互隔离。

  • 不用于训练

    您的提示词和文档绝不会用于训练任何人的模型。

  • 零留存

    为不得留下任何数据的工作负载而设。

只上线 我们测试过的模型

这个 API 上运行的每一个模型,我们都亲自评估过。它要么出自我们自己的研究,要么是我们跑过基准、部署并运维过之后才放上目录的开放权重模型。

  • 我们自己的成果

    我们自行开发的算法和模型,来自与客户项目并行推进的研究工作。

  • 开放权重,实测为准

    开源和开放权重模型在进入目录前都会在真实任务上跑基准,新版本发布时再测一次。

  • 没有黑箱

    我们不会把请求转发给自己无法检视、无法托管、无法解释的模型。跑不了的模型,就不会出现在目录里。

  • 一份看得懂的目录

    目录是配置而不是代码:我们新增、版本化和下线模型,您的应用一行都不用改,而且模型有变动时我们会提前告知。

把应用指向它

如果您的代码已经在用 OpenAI API,切换到自主可控的端点只需要改一个基础 URL 和一个密钥。告诉我们您在跑什么,我们和您一起做容量评估。