Gwenlake API

Une API unique compatible OpenAI pour le chat, les embeddings, le reranking et l’audio. Nous déployons pour vous des modèles open source sur une infrastructure souveraine et nous les opérons : les GPU, la montée en charge, les mises à jour, pour que vos applications ne voient jamais qu’un endpoint.

Quatre capacités, un seul endpoint

Un pipeline de recherche a besoin de plus qu’un modèle de chat. Tout ce qu’il faut est servi par la même API, sous la même clé et le même quota.

  • Chat & complétion

    Des LLM open source servis avec streaming, appels d’outils et sorties structurées, au format compatible OpenAI que vos bibliothèques parlent déjà.

  • Embeddings

    Vectorisez documents et requêtes avec les modèles d’embedding de votre choix, sur la même infrastructure souveraine que le reste.

  • Reranking

    Réordonnez les passages retrouvés selon leur pertinence réelle, l’étape qui transforme un RAG médiocre en RAG utilisable.

  • Audio

    La transcription des appels, réunions et enregistrements, qui contiennent autant de votre connaissance que vos documents.

Aucun tiers sur le chemin

L’inférence privée n’est pas une case que l’on coche. C’est la raison d’être du service.

  • Modèles à poids ouverts

    Déployés et opérés sur une infrastructure souveraine.

  • Endpoints dédiés

    Isolés par organisation et par projet.

  • Rien n’entraîne un modèle

    Vos prompts et vos documents ne servent jamais à entraîner le modèle d’un autre.

  • Rétention zéro

    Pour les traitements qui ne doivent laisser aucun payload.

Uniquement des modèles que nous avons testés

Rien ne tourne sur cette API que nous n’ayons évalué nous-mêmes. Soit le modèle vient de nos propres travaux, soit c’est un modèle open weights que nous avons mesuré, déployé et exploité avant de le proposer.

  • Nos propres travaux

    Les algorithmes et les modèles que nous développons nous-mêmes, issus de la recherche que nous poursuivons à côté des projets clients.

  • Open weights, mesurés

    Les modèles open source et open weights sont mesurés sur des tâches réelles avant d’entrer au catalogue, puis remesurés à chaque nouvelle version.

  • Pas de boîte noire

    Rien n’est relayé vers un modèle que nous ne pouvons ni inspecter, ni héberger, ni expliquer. Si nous ne pouvons pas le faire tourner nous-mêmes, il n’est pas proposé.

  • Un catalogue lisible

    Le catalogue est de la configuration, pas du code : nous ajoutons, versionnons et retirons des modèles sans que vos applications changent une ligne, et nous vous prévenons quand l’un d’eux bouge.

Pointez-y votre application

Si votre code parle déjà l’API OpenAI, passer à un endpoint souverain se résume à une URL de base et une clé. Dites-nous ce que vous exécutez et nous le dimensionnons avec vous.