CoolFace
Apppublic

codingsoft/zai-org-GLM-4.7-Flash

sourceHugging Faceupdated 8mo agoView on Hugging Face
0likes
App README

GLM-4.7-Flash API Endpoint

Este Space proporciona un endpoint API compatible con OpenAI para el modelo GLM-4.7-Flash.

Endpoints disponibles

1. Chat Completions

POST /v1/chat/completions

Request Body:

json
{
  "messages": [
    {"role": "user", "content": "Hola, ¿cómo estás?"}
  ],
  "max_tokens": 1024,
  "temperature": 0.8,
  "top_p": 0.8
}

Response:

json
{
  "id": "chatcmpl-xxxx",
  "object": "chat.completion",
  "created": 1234567890,
  "model": "THUDM/glm-4-9b-chat",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "¡Hola! Estoy bien, gracias por preguntar."
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 10,
    "completion_tokens": 15,
    "total_tokens": 25
  }
}

2. Health Check

GET /health

Response:

json
{
  "status": "healthy",
  "model_loaded": true,
  "device": "cuda:0"
}

Ejemplo de consumo con Python

python
import requests

API_URL = "https://codingsoft-zai-org-glm-4-7-flash.hf.space/v1/chat/completions"

response = requests.post(API_URL, json={
    "messages": [{"role": "user", "content": "Explica el modelo GLM-4.7-Flash en 3 puntos"}],
    "max_tokens": 512
})

print(response.json()["choices"][0]["message"]["content"])

Ejemplo con cURL

bash
curl -X POST "https://codingsoft-zai-org-glm-4-7-flash.hf.space/v1/chat/completions" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "¿Qué puedes hacer?"}],
    "max_tokens": 256
  }'

Requisitos

  • —Hardware: GPU (recomendado A10G o superior)
  • —Puerto: 8000 (configurado en Dockerfile)
  • —Dependencias: Ver requirements.txt

Configuración del modelo

El modelo se carga automáticamente al iniciar el servicio. Puedes modificar:

  1. 1.Nombre del modelo: Cambia MODEL_NAME en app.py
  2. 2.Parámetros de generación: Ajusta los valores por defecto en el endpoint
  3. 3.Configuración de hardware: Usa torch_dtype y device según tu GPU

Solución de problemas

ProblemaSolución
Modelo no cargaVerifica que el hardware sea GPU y que el modelo esté disponible
Error de memoriaReduce el tamaño del modelo con cuantización o usa una GPU con más VRAM
Timeout en respuestasAumenta max_tokens o reduce la complejidad de la consulta
Endpoint no accesibleVerifica que el puerto sea 8000 y que el Space esté en estado "Running"