Chat / LLM avec Velqa — API OpenAI-compatible payable en MAD
L'API de chat de Velqa suit exactement le format OpenAI POST /v1/chat/completions. Pour l'utiliser depuis un code existant, il suffit de changer la `base_url` en https://api.velqa.dev/v1 et d'utiliser votre clé sk-.... Vous payez en dirhams, sans carte internationale.
Requête minimale (curl)
curl https://api.velqa.dev/v1/chat/completions \
-H "Authorization: Bearer sk-..." \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.6",
"messages": [
{"role": "system", "content": "Tu es un assistant concis."},
{"role": "user", "content": "Explique le RAG en une phrase."}
],
"max_tokens": 200
}'Requête minimale (Python, SDK openai)
from openai import OpenAI
client = OpenAI(base_url="https://api.velqa.dev/v1", api_key="sk-...")
resp = client.chat.completions.create(
model="kimi-k2.6",
messages=[
{"role": "system", "content": "Tu es un assistant concis."},
{"role": "user", "content": "Explique le RAG en une phrase."},
],
max_tokens=200,
)
print(resp.choices[0].message.content)Forme de la requête
model— l'ID du modèle (voir modèles) ouvelqa-autopour laisser Velqa choisir (voir auto-router).messages— la conversation, une liste d'objets{"role": ..., "content": ...}. Les rôles sontsystem,user,assistant(ettoolpour le tool calling).max_tokens— borne le nombre de tokens générés en sortie. Utile pour maîtriser le coût et éviter de dépasser la fenêtre d'un modèle à petit contexte.temperature,top_p,stop… — les paramètres OpenAI usuels sont pris en charge.
Forme de la réponse
{
"id": "chatcmpl-...",
"object": "chat.completion",
"model": "kimi-k2.6",
"choices": [
{
"index": 0,
"message": {"role": "assistant", "content": "..."},
"finish_reason": "stop"
}
],
"usage": {"prompt_tokens": 42, "completion_tokens": 18, "total_tokens": 60}
}Le texte généré est dans choices[0].message.content. Le champ usage indique les tokens facturés (entrée + sortie).
Choisir un modèle
- Rapide et économique :
glm-4.7-flash,deepseek-v4-flash. - Coding et agentic :
kimi-k2.6,minimax-m3,glm-5.2,deepseek-v4-pro,qwen3.7-max. - Vous ne voulez pas choisir ? Utilisez
velqa-auto.
Les modèles de coding avancés requièrent une offre Dev ou supérieure. Voir modèles et offres.
Pour aller plus loin
- Streaming des réponses — recevoir le texte au fil de la génération (SSE).
- Tool calling / function calling — laisser le modèle appeler vos fonctions.
- Modèle velqa-auto — routage automatique selon votre offre.
