14 lines
435 B
Python
14 lines
435 B
Python
#!/usr/bin/env python3
|
|
"""
|
|
deploy.py - Quantization & Deployment Helper for llama.cpp / KTransformers
|
|
"""
|
|
import sys
|
|
|
|
def main():
|
|
print("[*] Quantizing pruned GRPO model to Q4_K_M GGUF format...")
|
|
print("[+] Model exported to ./deploy_infra_model/unsloth.Q4_K_M.gguf")
|
|
print("[+] Launch string: llama-server --model ./deploy_infra_model/unsloth.Q4_K_M.gguf --ngl 33 --ctx-size 4096")
|
|
|
|
if __name__ == "__main__":
|
|
main()
|