Aller au contenu principal
Velqa

Chat / LLM avec Velqa — API OpenAI-compatible payable en MAD

L'API de chat de Velqa suit exactement le format OpenAI POST /v1/chat/completions. Pour l'utiliser depuis un code existant, il suffit de changer la `base_url` en https://api.velqa.dev/v1 et d'utiliser votre clé sk-.... Vous payez en dirhams, sans carte internationale.

Requête minimale (curl)

curl https://api.velqa.dev/v1/chat/completions \
  -H "Authorization: Bearer sk-..." \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k2.6",
    "messages": [
      {"role": "system", "content": "Tu es un assistant concis."},
      {"role": "user", "content": "Explique le RAG en une phrase."}
    ],
    "max_tokens": 200
  }'

Requête minimale (Python, SDK openai)

from openai import OpenAI

client = OpenAI(base_url="https://api.velqa.dev/v1", api_key="sk-...")

resp = client.chat.completions.create(
    model="kimi-k2.6",
    messages=[
        {"role": "system", "content": "Tu es un assistant concis."},
        {"role": "user", "content": "Explique le RAG en une phrase."},
    ],
    max_tokens=200,
)

print(resp.choices[0].message.content)

Forme de la requête

  • model — l'ID du modèle (voir modèles) ou velqa-auto pour laisser Velqa choisir (voir auto-router).
  • messages — la conversation, une liste d'objets {"role": ..., "content": ...}. Les rôles sont system, user, assistant (et tool pour le tool calling).
  • max_tokens — borne le nombre de tokens générés en sortie. Utile pour maîtriser le coût et éviter de dépasser la fenêtre d'un modèle à petit contexte.
  • temperature, top_p, stop… — les paramètres OpenAI usuels sont pris en charge.

Forme de la réponse

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "model": "kimi-k2.6",
  "choices": [
    {
      "index": 0,
      "message": {"role": "assistant", "content": "..."},
      "finish_reason": "stop"
    }
  ],
  "usage": {"prompt_tokens": 42, "completion_tokens": 18, "total_tokens": 60}
}

Le texte généré est dans choices[0].message.content. Le champ usage indique les tokens facturés (entrée + sortie).

Choisir un modèle

  • Rapide et économique : glm-4.7-flash, deepseek-v4-flash.
  • Coding et agentic : kimi-k2.6, minimax-m3, glm-5.2, deepseek-v4-pro, qwen3.7-max.
  • Vous ne voulez pas choisir ? Utilisez velqa-auto.

Les modèles de coding avancés requièrent une offre Dev ou supérieure. Voir modèles et offres.

Pour aller plus loin