matthoffner/llama-cpp-server
Update Dockerfile
Update main.py
Update main.py
Update Dockerfile
Update Dockerfile
Delete start_server.sh
Update Dockerfile
Update Dockerfile
Update main.py
Update main.py
Update main.py
Update main.py
Update main.py
Update Dockerfile
Delete index.html
Update main.py
Update Dockerfile
Update Dockerfile
Update Dockerfile
Update Dockerfile
Update Dockerfile
Update Dockerfile
Update Dockerfile
Update Dockerfile
Update README.md
Update Dockerfile
Update main.py
Update Dockerfile
feat: updated to deepseek-coder-6.7B-instruct-GGUF
feat: updated to OpenHermes-2.5-Mistral-7B-GGUF model
feat: updated to openchat_3.5-GGUF model
feat: updated to agentlm-7B-GGUF model
feat: updated to WizardCoder-Python-7B-V1.0-GGUF model
feat: changed to dolphin-2.1-mistral-7B-GGUF model
feat: updated for Mistral-7B-OpenOrca-GGUF model
feat: enabled the embeddings endpoint
chore: removed OPENBLAS_NUM_THREADS as no performance improvement had been observed.
chore: updated OPENBLAS_NUM_THREADS to 2.
chore: added OPENBLAS_NUM_THREADS to specify the number of threads used by the OpenBLAS.
feat: added notebook on how to use the api and updated index.html to include the link to the notebook
feat: added Mistral-7B-Instruct-v0.1-GGUF (Q4_K_M) model
updated for the CodeLlama-13B-oasst-sft-v10-GGUF (Q4_K_M) model
Duplicate from limcheekin/WizardCoder-Python-13B-V1.0-GGUF
