Chat Completions

統一された API を通じて、さまざまな AI モデルで会話応答を生成します。

Chat Completion の作成

POST https://aiberm.com/v1/chat/completions

1curl https://aiberm.com/v1/chat/completions \
2-H "Content-Type: application/json" \
3-H "Authorization: Bearer YOUR_API_KEY" \
4-d '{
5 "model": "gpt-4",
6 "messages": [
7 {"role": "system", "content": "You are a helpful assistant."},
8 {"role": "user", "content": "What is the capital of France?"}
9 ],
10 "temperature": 0.7
11}'

リクエストパラメータ

パラメータ必須説明
modelstringはい使用するモデルの ID
messagesarrayはいメッセージオブジェクトの配列
temperaturenumberいいえサンプリング温度(0〜2)。デフォルト: 1
max_tokensintegerいいえ生成する最大トークン数
top_pnumberいいえニュークリアスサンプリングのパラメータ
streambooleanいいえレスポンスをストリーミングするかどうか

メッセージのロール

メッセージには rolecontent を含める必要があります。

  • system - アシスタントの振る舞い/人格を設定します
  • user - エンドユーザーからのメッセージ
  • assistant - AI の過去の応答

ストリーミング応答

ストリーミングを有効にすると、応答を段階的に受け取れます。

1from openai import OpenAI
2 
3client = OpenAI(
4 api_key="YOUR_API_KEY",
5 base_url="https://aiberm.com/v1"
6)
7 
8stream = client.chat.completions.create(
9 model="gpt-4",
10 messages=[{"role": "user", "content": "Tell me a story"}],
11 stream=True
12)
13 
14for chunk in stream:
15 if chunk.choices[0].delta.content:
16 print(chunk.choices[0].delta.content, end="")

ベストプラクティス

リクエストを最適化する
  • コストを抑えるために max_tokens を設定します
  • 適切な temperature を使います(事実ベースなら低め、創造的なら高め)
  • 振る舞いを誘導するためにシステムメッセージを含めます
  • UX 向上のためにレスポンスをストリーミングします
Warning

各モデルのトークン上限に注意してください。長い会話では会話履歴の管理が必要になる場合があります。