Текст, картинки и аудио

Кроме обычного текста моделям можно отправлять изображения и документы, а голос — переводить в текст. Возможности зависят от модели: в каталоге у каждой указано, что она принимает на вход.

Что поддерживается

ЗадачаКуда обращатьсяПример модели
Диалог и генерация текста/chat/completionsgpt-5.6-sol
Картинки и скриншоты на вход/chat/completionsgemini-3.7-flash
PDF и документы/chat/completionsgemini-3.7-flash
Речь в текст/audio/transcriptionsgpt-4o-transcribe
Векторный поиск/embeddingstext-embedding-3-large

Картинка в запросе

curl https://api.relaymodels.com/v1/chat/completions \
  -H "Authorization: Bearer $RELAY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Что на картинке?"},
        {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
      ]
    }]
  }'
Вместо ссылки можно передать изображение строкой base64 в том же поле — так удобнее для локальных файлов.

Распознавание речи

curl https://api.relaymodels.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $RELAY_API_KEY" \
  -F model=gpt-4o-transcribe \
  -F file=@voice.ogg

Векторы для поиска

curl https://api.relaymodels.com/v1/embeddings \
  -H "Authorization: Bearer $RELAY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "text-embedding-3-large", "input": "текст для поиска"}'

Доступ в интернет

Сами модели в интернет не выходят. Если нужны свежие данные, добавьте в своём коде инструмент поиска и передайте результат в запрос — как это делается, показано в разделе «Инструменты».

Что дальше