Erinaldordso/ml-intern-ollama-proxy
0
🦙 ML Intern + Ollama Proxy
Space Docker que combina ML Intern (agente autônomo HF) com Ollama (LLM local).
Endpoint OpenAI-compatible gratuito — sem créditos de API!
🔗 Endpoints
🚀 Como usar no seu OpenClaude/Agente
Substitua seu endpoint HF Inference por seu próprio Space:
Antes (requer créditos):
const ENDPOINT = "https://api-inference.huggingface.co/models/Qwen/Qwen2.5-72B-Instruct/v1/chat/completions";Depois (GRATUITO — seu próprio Space):
const ENDPOINT = "https://erinaldordso-ml-intern-ollama-proxy.hf.space/v1/chat/completions";Exemplo de request:
curl -X POST https://erinaldordso-ml-intern-ollama-proxy.hf.space/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen2.5:3b",
"messages": [{"role": "user", "content": "Ola!"}],
"stream": false
}'Com tool calling:
curl -X POST https://erinaldordso-ml-intern-ollama-proxy.hf.space/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen2.5:3b",
"messages": [{"role": "user", "content": "Calcule 15 * 23 + 7"}],
"tools": [{
"type": "function",
"function": {
"name": "calculator",
"description": "Calculate math",
"parameters": {
"type": "object",
"properties": {
"expression": {"type": "string"}
},
"required": ["expression"]
}
}
}]
}'🧠 Modelo: Qwen2.5:3b
Speed em CPU (cpu-basic): ~10-20 tokens/segundo
⚙️ Primeiro uso
⏳ Aguarde 3-5 minutos após o primeiro deploy para o Ollama baixar o modelo (~2GB).
Verifique se está pronto:
curl https://erinaldordso-ml-intern-ollama-proxy.hf.space/api/health🔑 Secrets (opcional)
🐳 Docker Local
Se quiser rodar localmente com mais performance:
git clone https://github.com/huggingface/ml-intern.git
cd ml-intern
# Instale Ollama localmente + configure o proxyCriado por: Erinaldordso Baseado em: ML Intern (HuggingFace) + Ollama
