https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
export HF_HUB_OFFLINE=1
source /data/D/python312_venv/bin/activate
cd /data/E/Strata-0.1.38
IQ3_S:
./setup.sh --gguf-dir /data/H/LLM/Qwen3.8-Flash-Next-GSQ-RCO-GGUF_ISTA-DASLab \
--model IQ3_S\
--family qwen \
--data-dir /data/E/Strata-data \
--context 262144 \
--kv int8 \
--experimental-speed-projection off \
--vision yes \
--port 8099
UD-Q4_K_XL:
./setup.sh --gguf-dir /data/E/Qwen3.8-Flash-Next-GGUF_unsloth \
--model UD-Q4_K_XL \
--family unsloth \
--data-dir /data/E/Strata-data \
--context 262144 \
--kv int8 \
--experimental-speed-projection off \
--vision yes \
--port 8099
IQ3_S 120-160 token/s 235520/262144死循环
UD-Q4_K_XL 70-110 token/s 115520/131072medium稳定,194560/204800medium稳定,221184/245760medium稳定,245760/262144medium稳定,245760/262144xhigh思考死循环卡住一段时间直到超限
第一次启动时需要calibrate,添加vision支持:
nano strata-unsloth-ud-q4_k_xl.json
"args": [
...
"--vision",
"--resident-budget-gib",
"71",
...
]
"fit_max_tokens": true,
"vision": {
"exe": "/data/E/Strata-0.1.38/engine/strata-vision",
"mmproj": "/data/E/Strata-data/models/mmproj-Qwen3.8-Flash-Next-BF16-unsloth.gguf",
"model": "/data/E/Qwen3.8-Flash-Next-GGUF_unsloth/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf",
"gpu": true,
"max_tokens": 1024
}
后续使用这条命令启动:
.venv/bin/python -m serve.server --engine strata --config strata-unsloth-ud-q4_k_xl.json --port 8099
检查agent有无自带temperature等参数:
.venv/bin/python -m serve.server --engine strata --config strata-unsloth-ud-q4_k_xl.json --port 8099 --api-monitor
打开网页:
http://127.0.0.1:8099/api-monitor
手动测试:
curl http://127.0.0.1:8099/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer xxx" \
-d '{
"model":"Qwen3.8-Flash-Next",
"messages":[
{
"role":"user",
"content":"hello"
}
],
"temperature":0.2,
"top_p":0.95,
"top_k":40
}'
可以看到请求中带了temperature等参数,在agent中发消息检查log中是否有temperature,默认应该是没有的
cluade code需要使用cc switch以支持temperature参数:
Body覆盖:
{
"temperature": 1,
"top_p": 0.95,
"top_k": 20,
"min_p": 0,
"presence_penalty": 0,
"repetition_penalty": 1,
"max_tokens": 32000
}
~/.claude/settings.json
"model": "fable",
"modelSettings": {
"fable": {
"effortLevel": "xhigh"
}
}
在agent中发消息检查log中的参数已否以更新