Chat Completions

Erstellen Sie Gesprächsantworten mit verschiedenen KI-Modellen über eine einheitliche API.

Chat Completion erstellen

POST https://aiberm.com/v1/chat/completions

1curl https://aiberm.com/v1/chat/completions \
2-H "Content-Type: application/json" \
3-H "Authorization: Bearer YOUR_API_KEY" \
4-d '{
5 "model": "gpt-4",
6 "messages": [
7 {"role": "system", "content": "You are a helpful assistant."},
8 {"role": "user", "content": "What is the capital of France?"}
9 ],
10 "temperature": 0.7
11}'

Anfrageparameter

ParameterTypErforderlichBeschreibung
modelstringJaID des zu verwendenden Modells
messagesarrayJaArray von Nachrichtenobjekten
temperaturenumberNeinSampling-Temperatur (0–2). Standard: 1
max_tokensintegerNeinMaximale Anzahl zu erzeugender Tokens
top_pnumberNeinNucleus-Sampling-Parameter
streambooleanNeinOb Antworten gestreamt werden sollen

Nachrichtenrollen

Nachrichten müssen eine role und content enthalten:

  • system – Legt Verhalten und Persönlichkeit des Assistenten fest
  • user – Nachrichten des Endbenutzers
  • assistant – Vorherige Antworten der KI

Streaming-Antworten

Aktivieren Sie Streaming, um Antworten schrittweise zu empfangen:

1from openai import OpenAI
2 
3client = OpenAI(
4 api_key="YOUR_API_KEY",
5 base_url="https://aiberm.com/v1"
6)
7 
8stream = client.chat.completions.create(
9 model="gpt-4",
10 messages=[{"role": "user", "content": "Tell me a story"}],
11 stream=True
12)
13 
14for chunk in stream:
15 if chunk.choices[0].delta.content:
16 print(chunk.choices[0].delta.content, end="")

Best Practices

Optimieren Sie Ihre Anfragen
  • Setzen Sie max_tokens, um Kosten zu begrenzen
  • Verwenden Sie passende temperature-Werte (niedriger für sachliche, höher für kreative Ausgaben)
  • Fügen Sie Systemnachrichten hinzu, um das Verhalten zu steuern
  • Streamen Sie Antworten für eine bessere UX
Warning

Beachten Sie die Token-Limits jedes Modells. Längere Gespräche erfordern möglicherweise eine Verwaltung des Gesprächsverlaufs.