codingsoft/zai-org-GLM-4.7-Flash
0
GLM-4.7-Flash API Endpoint
Este Space proporciona un endpoint API compatible con OpenAI para el modelo GLM-4.7-Flash.
Endpoints disponibles
1. Chat Completions
POST /v1/chat/completions
Request Body:
{
"messages": [
{"role": "user", "content": "Hola, ¿cómo estás?"}
],
"max_tokens": 1024,
"temperature": 0.8,
"top_p": 0.8
}Response:
{
"id": "chatcmpl-xxxx",
"object": "chat.completion",
"created": 1234567890,
"model": "THUDM/glm-4-9b-chat",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "¡Hola! Estoy bien, gracias por preguntar."
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 10,
"completion_tokens": 15,
"total_tokens": 25
}
}2. Health Check
GET /health
Response:
{
"status": "healthy",
"model_loaded": true,
"device": "cuda:0"
}Ejemplo de consumo con Python
import requests
API_URL = "https://codingsoft-zai-org-glm-4-7-flash.hf.space/v1/chat/completions"
response = requests.post(API_URL, json={
"messages": [{"role": "user", "content": "Explica el modelo GLM-4.7-Flash en 3 puntos"}],
"max_tokens": 512
})
print(response.json()["choices"][0]["message"]["content"])Ejemplo con cURL
curl -X POST "https://codingsoft-zai-org-glm-4-7-flash.hf.space/v1/chat/completions" \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "¿Qué puedes hacer?"}],
"max_tokens": 256
}'Requisitos
- Hardware: GPU (recomendado A10G o superior)
- Puerto: 8000 (configurado en Dockerfile)
- Dependencias: Ver
requirements.txt
Configuración del modelo
El modelo se carga automáticamente al iniciar el servicio. Puedes modificar:
- Nombre del modelo: Cambia
MODEL_NAMEenapp.py - Parámetros de generación: Ajusta los valores por defecto en el endpoint
- Configuración de hardware: Usa
torch_dtypeydevicesegún tu GPU
