Chat Completions
Erstellen Sie Gesprächsantworten mit verschiedenen KI-Modellen über eine einheitliche API.
Chat Completion erstellen
POST https://aiberm.com/v1/chat/completions
1curl https://aiberm.com/v1/chat/completions \2-H "Content-Type: application/json" \3-H "Authorization: Bearer YOUR_API_KEY" \4-d '{5 "model": "gpt-4",6 "messages": [7 {"role": "system", "content": "You are a helpful assistant."},8 {"role": "user", "content": "What is the capital of France?"}9 ],10 "temperature": 0.711}'Anfrageparameter
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
model | string | Ja | ID des zu verwendenden Modells |
messages | array | Ja | Array von Nachrichtenobjekten |
temperature | number | Nein | Sampling-Temperatur (0–2). Standard: 1 |
max_tokens | integer | Nein | Maximale Anzahl zu erzeugender Tokens |
top_p | number | Nein | Nucleus-Sampling-Parameter |
stream | boolean | Nein | Ob Antworten gestreamt werden sollen |
Nachrichtenrollen
Nachrichten müssen eine role und content enthalten:
- system – Legt Verhalten und Persönlichkeit des Assistenten fest
- user – Nachrichten des Endbenutzers
- assistant – Vorherige Antworten der KI
Streaming-Antworten
Aktivieren Sie Streaming, um Antworten schrittweise zu empfangen:
1from openai import OpenAI2 3client = OpenAI(4 api_key="YOUR_API_KEY",5 base_url="https://aiberm.com/v1"6)7 8stream = client.chat.completions.create(9 model="gpt-4",10 messages=[{"role": "user", "content": "Tell me a story"}],11 stream=True12)13 14for chunk in stream:15 if chunk.choices[0].delta.content:16 print(chunk.choices[0].delta.content, end="")Best Practices
Optimieren Sie Ihre Anfragen
- Setzen Sie
max_tokens, um Kosten zu begrenzen - Verwenden Sie passende
temperature-Werte (niedriger für sachliche, höher für kreative Ausgaben) - Fügen Sie Systemnachrichten hinzu, um das Verhalten zu steuern
- Streamen Sie Antworten für eine bessere UX
Warning
Beachten Sie die Token-Limits jedes Modells. Längere Gespräche erfordern möglicherweise eine Verwaltung des Gesprächsverlaufs.