Unlike the official OpenAI client, Muna allows you to specify where the inference runs per-request:
H100s, B200s, or on the local device.
Creating Chat Completions
Muna supports running large language models via our client’sopenai.chat.completions.create API:
Streaming Completions
Our OpenAI client also supports creating streaming completions:Creating Embeddings
Muna supports running text embedding models via our client’sopenai.embeddings.create API:
Creating Speech
Muna supports running text-to-speech models via our client’sopenai.audio.speech.create API:
Creating Transcriptions
Muna supports using speech-to-text models via our client’sopenai.audio.transcriptions.create API: