# DeepInfra — https://deepinfra.com # Serverless open-model inference (Llama, Mistral, Qwen, etc.) [provider] id = "deepinfra" display_name = "DeepInfra" api_key_env = "DEEPINFRA_API_KEY" base_url = "https://api.deepinfra.com/v1/openai" key_required = true [[models]] id = "meta-llama/Meta-Llama-3.1-8B-Instruct" display_name = "Llama 3.1 8B Instruct" tier = "fast" context_window = 128000 max_output_tokens = 8192 input_cost_per_m = 0.06 output_cost_per_m = 0.06 supports_tools = true supports_vision = false supports_streaming = true [[models]] id = "meta-llama/Meta-Llama-3.1-70B-Instruct" display_name = "Llama 3.1 70B Instruct" tier = "balanced" context_window = 128000 max_output_tokens = 8192 input_cost_per_m = 0.35 output_cost_per_m = 0.4 supports_tools = true supports_vision = false supports_streaming = true [[models]] id = "meta-llama/Meta-Llama-3.1-405B-Instruct" display_name = "Llama 3.1 405B Instruct" tier = "smart" context_window = 128000 max_output_tokens = 8192 input_cost_per_m = 0.8 output_cost_per_m = 0.8 supports_tools = true supports_vision = false supports_streaming = true [[models]] id = "mistralai/Mistral-7B-Instruct-v0.3" display_name = "Mistral 7B Instruct v0.3" tier = "fast" context_window = 32768 max_output_tokens = 8192 input_cost_per_m = 0.07 output_cost_per_m = 0.07 supports_tools = true supports_vision = false supports_streaming = true [[models]] id = "Qwen/Qwen2.5-72B-Instruct" display_name = "Qwen 2.5 72B Instruct" tier = "balanced" context_window = 32768 max_output_tokens = 8192 input_cost_per_m = 0.35 output_cost_per_m = 0.4 supports_tools = true supports_vision = false supports_streaming = true