v1 inference (deprecated)
[Deprecated] Multimodal completion with optional audio/image output
DEPRECATED — Use the new dedicated endpoints instead: - Text → POST /v1/text/generations - Image → POST /v1/images/generations - Audio → POST /v1/audio/generations - All → POST /v1/chat/completions
This endpoint is kept for backward compatibility and internally delegates to
the appropriate new generation handler based on `output_type`.
post/v1/inference/multimodality-completion
Request body
Example request
{
"audio_base64": "base64_encoded_audio...",
"audio_type": "tts",
"disabled_learning": false,
"image_base64": "base64_encoded_image...",
"model": "gemini-2.5-flash",
"output_type": "text",
"question": "What do you see?",
"session_id": "session_123",
"speed": 1,
"user_id": "123e4567-e89b-12d3-a456-426614174000",
"video_base64": "base64_encoded_video...",
"voice": "alloy"
}Response
Successful Response
Example response
{
"audio_base64": "base64_encoded_audio...",
"audio_format": "mp3",
"image_base64": "base64_encoded_image...",
"memory_context": "Retrieved memories: ...",
"raw_results": {
"episodes": [],
"preferences": []
},
"success": true,
"text_response": "Based on your preferences, you prefer to wake up early...",
"voice_used": "alloy"
}