注:文后附llama.cpp环境变量编辑器及源码
通用参数 common params
-h, --help, --usage
打印使用帮助并退出程序
--version
输出程序版本与编译构建信息
-cl, --cache-list
列出本地缓存中已下载的模型
--completion-bash
输出可直接导入的 Bash 自动补全脚本
-t, --threads N
文本生成阶段使用的 CPU 线程数(默认:-1)
环境变量:LLAMA_ARG_THREADS
-tb, --threads-batch N
批量处理、提示词预处理阶段使用的线程数(默认与 --threads 一致)
-C, --cpu-mask M
CPU 亲和掩码:任意长度十六进制字符串,与 cpu-range 配合使用(默认空)
-Cr, --cpu-range lo-hi
绑定使用的 CPU 核心区间,与 --cpu-mask 配合使用
--cpu-strict <0|1>
开启严格 CPU 核心绑定(默认:0 关闭)
--prio N
设置进程 / 线程优先级:-1 低、0 普通、1 中等、2 高、3 实时(默认:0)
--poll <0...100>
工作轮询等待等级;0 = 不启用轮询(默认:50)
-Cb, --cpu-mask-batch M
批量任务专用 CPU 亲和掩码,配合 cpu-range-batch(默认同 --cpu-mask)
-Crb, --cpu-range-batch lo-hi
批量任务绑定的 CPU 核心区间,配合 --cpu-mask-batch
--cpu-strict-batch <0|1>
批量任务启用严格 CPU 绑定(默认同 --cpu-strict)
--prio-batch N
批量任务线程优先级:0 普通、1 中等、2 高、3 实时(默认:0)
--poll-batch <0|1>
批量任务启用工作轮询等待(默认同 --poll)
-c, --ctx-size N
上下文窗口大小(默认:0,0 表示从模型配置读取)
环境变量:LLAMA_ARG_CTX_SIZE
-n, --predict, --n-predict N
最大生成 token 数量(默认:-1,-1 代表无限生成)
环境变量:LLAMA_ARG_N_PREDICT
-b, --batch-size N
逻辑最大批量尺寸(默认:2048)
环境变量:LLAMA_ARG_BATCH
-ub, --ubatch-size N
物理最大微批量尺寸(默认:512)
环境变量:LLAMA_ARG_UBATCH
--keep N
保留原始提示词前 N 个 token 不被上下文滑动丢弃(默认:0;-1 = 全部保留)
--swa-full
启用完整尺寸 SWA 缓存(默认:false)
参考文档:https://github.com/ggml-org/llama.cpp/pull/13194#issuecomment-2868343055
环境变量:LLAMA_ARG_SWA_FULL
-fa, --flash-attn [on|off|auto]
FlashAttention 开关:on 开启 /off 关闭 /auto 自动(默认 auto)
环境变量:LLAMA_ARG_FLASH_ATTN
--perf, --no-perf
开启内置性能计时打点(默认关闭)
环境变量:LLAMA_ARG_PERF
-e, --escape, --no-escape
解析转义字符(\n \r \t ‘ ” \)(默认开启)
--rope-scaling {none,linear,yarn}
RoPE 频率缩放方案;未指定时模型内置配置优先,默认 linear
环境变量:LLAMA_ARG_ROPE_SCALING_TYPE
--rope-scale N
RoPE 上下文缩放系数,上下文窗口扩大 N 倍
环境变量:LLAMA_ARG_ROPE_SCALE
--rope-freq-base N
RoPE 基础频率,用于 NTK 缩放(默认从模型读取)
环境变量:LLAMA_ARG_ROPE_FREQ_BASE
--rope-freq-scale N
RoPE 频率缩放系数,上下文窗口缩小至 1/N
环境变量:LLAMA_ARG_ROPE_FREQ_SCALE
--yarn-orig-ctx N
YaRN 缩放:模型原生训练上下文长度(默认 0,自动读取模型训练窗口)
环境变量:LLAMA_ARG_YARN_ORIG_CTX
--yarn-ext-factor N
YaRN:外推混合系数(默认 – 1.0;0.0 = 纯插值)
环境变量:LLAMA_ARG_YARN_EXT_FACTOR
--yarn-attn-factor N
YaRN:注意力幅值 /sqrt (t) 缩放系数(默认 – 1.0)
环境变量:LLAMA_ARG_YARN_ATTN_FACTOR
--yarn-beta-slow N
YaRN:高维修正系数 alpha(默认 – 1.0)
环境变量:LLAMA_ARG_YARN_BETA_SLOW
--yarn-beta-fast N
YaRN:低维修正系数 beta(默认 – 1.0)
环境变量:LLAMA_ARG_YARN_BETA_FAST
-kvo, --kv-offload / -nkvo, --no-kv-offload
KV 缓存硬件卸载开关(默认开启)
环境变量:LLAMA_ARG_KV_OFFLOAD
--repack / -nr, --no-repack
权重重打包优化开关(默认开启)
环境变量:LLAMA_ARG_REPACK
--no-host
绕过主机内存缓冲区,启用额外设备缓冲区
环境变量:LLAMA_ARG_NO_HOST
-ctk, --cache-type-k TYPE
KV 缓存 K 张量数据类型
可选值:f32、f16、bf16、q8_0、q4_0、q4_1、iq4_nl、q5_0、q5_1(默认 f16)
环境变量:LLAMA_ARG_CACHE_TYPE_K
-ctv, --cache-type-v TYPE
KV 缓存 V 张量数据类型,可选值同上(默认 f16)
环境变量:LLAMA_ARG_CACHE_TYPE_V
-dt, --defrag-thold N
KV 缓存碎片整理阈值(已弃用)
环境变量:LLAMA_ARG_DEFRAG_THOLD
--rpc SERVERS
RPC 分布式节点地址列表,多节点逗号分隔 格式:主机:端口
环境变量:LLAMA_ARG_RPC
--mlock
已弃用,推荐使用 --load-mode;强制系统将模型锁定在内存,禁止交换压缩
环境变量:LLAMA_ARG_MLOCK
--mmap, --no-mmap
已弃用,推荐 --load-mode;是否使用内存映射加载模型;关闭时加载更慢,但不锁定内存可减少页面置换
环境变量:LLAMA_ARG_MMAP
-dio, --direct-io / -ndio, --no-direct-io
已弃用,推荐 --load-mode;可用时启用 DirectIO 直读
环境变量:LLAMA_ARG_DIO
-lm, --load-mode MODE
模型加载模式(默认 mmap)
- none:无特殊加载策略
- mmap:内存映射加载
- mlock:锁定模型至物理内存,禁止交换
- mmap+mlock:映射 + 内存锁定组合
- dio:直读 IO 模式(硬件支持时生效)
环境变量:
LLAMA_ARG_LOAD_MODE
--numa TYPE
多 NUMA 节点优化策略
- distribute:任务均匀分发至所有 NUMA 节点
- isolate:仅在启动进程的 NUMA 节点创建线程
- numactl:读取系统 numactl 配置绑定 CPU
首次使用建议清空系统页缓存
参考:https://github.com/ggml-org/llama.cpp/issues/1437
环境变量:
LLAMA_ARG_NUMA
-dev, --device <dev1,dev2,..>
用于模型卸载的硬件设备列表,逗号分隔;none = 不卸载
使用 --list-devices 查看可用硬件
环境变量:LLAMA_ARG_DEVICE
--list-devices
打印本机可用加速设备列表并退出
-ot, --override-tensor <张量匹配规则>=<缓存类型>,...
强制指定特定张量使用的缓冲区类型
环境变量:LLAMA_ARG_OVERRIDE_TENSOR
-cmoe, --cpu-moe
所有 MoE 专家层权重保留在 CPU 内存
环境变量:LLAMA_ARG_CPU_MOE
-ncmoe, --n-cpu-moe N
前 N 层 MoE 专家权重保留在 CPU 内存
环境变量:LLAMA_ARG_N_CPU_MOE
-ngl, --gpu-layers, --n-gpu-layers N
加载至显存的模型最大层数;支持数字 /auto/all(默认 auto)
环境变量:LLAMA_ARG_N_GPU_LAYERS
-sm, --split-mode {none,layer,row,tensor}
多 GPU 模型拆分策略
- none:仅单卡运行
- layer(默认):层流水线拆分,KV 缓存随层分配
- row:权重按行并行拆分
- tensor:完整张量并行拆分(实验性功能)
环境变量:
LLAMA_ARG_SPLIT_MODE
-ts, --tensor-split N0,N1,N2,...
多卡权重分配比例,逗号分隔数字,例 3,1
环境变量:LLAMA_ARG_TENSOR_SPLIT
-mg, --main-gpu INDEX
主 GPU 编号:split-mode=none 时全局主卡;split-mode=row 时存放中间计算与 KV 缓存(默认 0)
环境变量:LLAMA_ARG_MAIN_GPU
-fit, --fit [on|off]
自动调整未指定参数,适配设备显存容量(默认 on)
环境变量:LLAMA_ARG_FIT
-fitt, --fit-target MiB0,MiB1,MiB2,...
自动适配功能为每张设备预留显存余量(单位 MiB);单数值全局生效,默认 1024
环境变量:LLAMA_ARG_FIT_TARGET
-fitc, --fit-ctx N
自动适配功能允许设置的最小上下文窗口大小,默认 4096
环境变量:LLAMA_ARG_FIT_CTX
--check-tensors
校验模型张量是否存在非法异常值(默认关闭)
--override-kv KEY=TYPE:VALUE,...
高级参数:按键覆盖模型元数据,多组逗号分隔
支持类型 int/float/bool/str
示例:--override-kv tokenizer.ggml.add_bos_token=bool:false,tokenizer.ggml.add_eos_token=bool:false
--op-offload, --no-op-offload
主机张量运算卸载至加速设备(默认开启)
--lora FNAME
LoRA 微调适配器文件路径;多适配器逗号分隔加载
--lora-scaled FNAME:SCALE,...
带自定义缩放系数的 LoRA 适配器,格式 文件路径:缩放值,多组逗号分隔
--control-vector FNAME
加载控制向量文件;多文件逗号分隔叠加
--control-vector-scaled FNAME:SCALE,...
带自定义缩放系数的控制向量,格式 文件:系数
--control-vector-layer-range START END
控制向量生效层区间,首尾层均包含
-m, --model FNAME
本地模型文件路径
环境变量:LLAMA_ARG_MODEL
-mu, --model-url MODEL_URL
模型在线下载链接(默认不启用)
环境变量:LLAMA_ARG_MODEL_URL
-dr, --docker-repo [<仓库>/]<模型>[:量化版本]
Docker Hub 模型仓库地址
仓库名可选,默认 ai/;量化标签可选,默认 latest
示例:gemma3
环境变量:LLAMA_ARG_DOCKER_REPO
-hf, -hfr, --hf-repo <用户名>/<模型仓库>[:量化]
HuggingFace 模型仓库地址,量化标签大小写不敏感,默认 Q4_K_M;无该量化则下载仓库首个 GGUF 文件
多模态模型自动下载 mmproj 投影文件,添加--no-mmproj可关闭
示例:ggml-org/GLM-4.7-Flash-GGUF:Q4_K_M
环境变量:LLAMA_ARG_HF_REPO
-hff, --hf-file FILE
指定下载 HF 仓库内特定模型文件,覆盖--hf-repo的量化参数
环境变量:LLAMA_ARG_HF_FILE
-hfv, -hfrv, --hf-repo-v <用户名>/<模型>[:量化]
音频声码器专用 HF 仓库(默认不启用)
环境变量:LLAMA_ARG_HF_REPO_V
-hffv, --hf-file-v FILE
声码器模型指定文件路径
环境变量:LLAMA_ARG_HF_FILE_V
-hft, --hf-token TOKEN
HuggingFace 访问令牌;默认读取环境变量 HF_TOKEN
环境变量:HF_TOKEN
--log-disable
关闭全部日志输出
--log-file FNAME
日志输出至指定文件
环境变量:LLAMA_ARG_LOG_FILE
--log-colors [on|off|auto]
彩色日志开关;auto 仅终端输出启用色彩(默认 auto)
环境变量:LLAMA_ARG_LOG_COLORS
-v, --verbose, --log-verbose
日志等级拉满,输出全部调试信息,排错专用
--offline
离线模式:强制使用本地缓存,阻断网络请求
环境变量:LLAMA_ARG_OFFLINE
-lv, --verbosity, --log-verbosity N
日志输出阈值,高于该等级日志会被过滤
0:普通输出
1:错误
2:警告
3:信息(默认)
4:详细追踪
5:调试
环境变量:LLAMA_ARG_LOG_VERBOSITY
--log-prefix, --no-log-prefix
日志行输出模块前缀标识
--log-timestamps, --no-log-timestamps
日志行附加时间戳
--spec-draft-type-k, -ctkd, --cache-type-k-draft TYPE
推测解码草稿模型 K 张量缓存数据类型,可选值同主模型 KV 缓存(默认 f16)
环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_K
--spec-draft-type-v, -ctvd, --cache-type-v-draft TYPE
推测解码草稿模型 V 张量缓存数据类型(默认 f16)
环境变量:LLAMA_ARG_SPEC_DRAFT_CACHE_TYPE_V
采样参数 sampling params
--samplers SAMPLERS
文本生成采样器执行顺序,分号分隔
默认顺序:penalties;dry;top_n_sigma;top_k;typ_p;top_p;min_p;xtc;temperature
-s, --seed SEED
随机数种子;-1 = 随机种子(默认 – 1)
--sampler-seq, --sampling-seq SEQUENCE
简化采样器序列简写,默认 edskypmxt
--ignore-eos
忽略结束符 EOS,持续生成文本;等效自动开启--logit-bias EOS-inf
--temp, --temperature N
生成温度,控制随机性(默认 0.80)
--top-k N
Top-K 采样;0 = 关闭(默认 40)
环境变量:LLAMA_ARG_TOP_K
--top-p N
Top-P 核采样;1.0 = 关闭(默认 0.95)
--min-p N
Min-P 采样;0.0 = 关闭(默认 0.05)
--top-nsigma, --top-n-sigma N
Top-N-Sigma 采样;-1 = 关闭(默认 – 1.00)
--xtc-probability N
XTC 采样概率阈值;0 = 关闭(默认 0.00)
--xtc-threshold N
XTC 过滤阈值;1.0 = 关闭(默认 0.10)
--typical, --typical-p N
局部典型采样;1.0 = 关闭(默认 1.00)
--repeat-last-n N
重复惩罚统计窗口 token 数量;0 关闭、-1 等于上下文总长度(默认 64)
--repeat-penalty N
重复序列惩罚系数;1.0 关闭惩罚(默认 1.00)
--presence-penalty N
存在惩罚;0 关闭(默认 0.00)
--frequency-penalty N
频率惩罚;0 关闭(默认 0.00)
--dry-multiplier N
DRY 去重复采样倍率;0 关闭(默认 0.00)
--dry-base N
DRY 采样基础系数(默认 1.75)
--dry-allowed-length N
DRY 检测重复序列最小长度(默认 2)
--dry-penalty-last-n N
DRY 惩罚统计窗口;0 关闭、-1 等于上下文长度(默认 – 1)
--dry-sequence-breaker STRING
自定义 DRY 序列分隔符,覆盖默认换行 / 冒号 / 引号 /*;传入 none 禁用分隔符
--adaptive-target N
自适应 P 采样目标概率区间;负数关闭(默认 – 1.00,范围 0~1)
--adaptive-decay N
自适应 P 衰减系数;数值越低响应越快、越高越稳定(0~0.99,默认 0.90)
--dynatemp-range N
动态温度区间;0 关闭(默认 0.00)
--dynatemp-exp N
动态温度指数系数(默认 1.00)
--mirostat N
Mirostat 采样开关;0 关闭、1=Mirostat v1、2=Mirostat 2.0
启用后自动忽略 TopK、核采样、典型采样(默认 0)
--mirostat-lr N
Mirostat 学习率 eta(默认 0.10)
--mirostat-ent N
Mirostat 目标熵 tau(默认 5.00)
-l, --logit-bias TOKEN_ID(+/-)BIAS
修改指定 token 生成概率
示例:--logit-bias 15043+1 提高 Hello 生成概率;15043-1降低
--grammar GRAMMAR
BNF 格式语法约束,限制模型输出格式;示例文件见 grammars 目录
--grammar-file FNAME
从文件读取语法约束规则
-j, --json-schema SCHEMA
JSON Schema 约束生成 JSON 输出,{}代表任意 JSON 对象
外部 $ref 引用 schema 需改用 grammar + 配套转换脚本
-jf, --json-schema-file FILE
文件加载 JSON 格式约束规则,外部引用同上述限制
-bs, --backend-sampling
后端硬件采样加速(实验性功能,默认关闭)
环境变量:LLAMA_ARG_BACKEND_SAMPLING
推测解码参数 speculative params
--spec-draft-hf, -hfd, -hfrd, --hf-repo-draft <用户>/<模型>[:量化]
草稿模型专用 HF 仓库,参数规则同--hf-repo(默认不启用)
环境变量:LLAMA_ARG_SPEC_DRAFT_HF_REPO
--spec-draft-threads, -td, --threads-draft N
草稿模型生成阶段 CPU 线程数(默认同主模型 –threads)
--spec-draft-threads-batch, -tbd, --threads-batch-draft N
草稿模型批量预处理线程(同草稿主线程)
--spec-draft-cpu-mask, -Cd, --cpu-mask-draft M
草稿模型 CPU 亲和掩码,配合 cpu-range-draft(默认同主模型掩码)
--spec-draft-cpu-range, -Crd, --cpu-range-draft lo-hi
草稿模型绑定 CPU 核心区间
--spec-draft-cpu-strict, --cpu-strict-draft <0|1>
草稿模型启用严格 CPU 绑定(默认同主模型)
--spec-draft-prio, --prio-draft N
草稿进程线程优先级:0 普通 / 1 中等 / 2 高 / 3 实时(默认 0)
--spec-draft-poll, --poll-draft <0|1>
草稿任务启用轮询等待(默认同主模型 poll)
--spec-draft-cpu-mask-batch, -Cbd, --cpu-mask-batch-draft M
草稿批量任务 CPU 掩码(默认同主模型批量掩码)
--spec-draft-cpu-strict-batch, --cpu-strict-batch-draft <0|1>
草稿批量严格 CPU 绑定(默认草稿 cpu-strict)
--spec-draft-prio-batch, --prio-batch-draft N
草稿批量线程优先级(默认 0)
--spec-draft-poll-batch, --poll-batch-draft <0|1>
草稿批量轮询开关(默认同草稿 poll)
-otd, --override-tensor-draft <张量规则>=<缓存类型>
单独强制草稿模型张量缓存类型
-cmoed, --cpu-moe-draft
草稿模型全部 MoE 层权重存放 CPU 内存
环境变量:LLAMA_ARG_SPEC_DRAFT_CPU_MOE
-ncmoed, --n-cpu-moe-draft N
草稿模型前 N 层 MoE 权重保留 CPU 内存
环境变量:LLAMA_ARG_SPEC_DRAFT_N_CPU_MOE
--spec-draft-n-max N
单次推测解码草稿最大 token 数量(默认 3)
环境变量:LLAMA_ARG_SPEC_DRAFT_N_MAX
--spec-draft-n-min N
单次推测最小草稿 token 数(默认 0)
环境变量:LLAMA_ARG_SPEC_DRAFT_N_MIN
--spec-draft-p-split, --draft-p-split P
推测分支拆分概率(默认 0.10)
环境变量:LLAMA_ARG_SPEC_DRAFT_P_SPLIT
--spec-draft-p-min, --draft-p-min P
贪心推测最小概率阈值(默认 0.00)
环境变量:LLAMA_ARG_SPEC_DRAFT_P_MIN
--spec-draft-backend-sampling, --no-spec-draft-backend-sampling
草稿模型采样卸载至硬件后端(默认开启)
环境变量:LLAMA_ARG_SPEC_DRAFT_BACKEND_SAMPLING
-devd, --device-draft <dev1,dev2,..>
草稿模型硬件卸载设备列表;none = 不卸载,用--list-devices查看硬件
-ngld, --gpu-layers-draft N
草稿模型加载至显存最大层数,支持数字 /auto/all(默认 auto)
环境变量:LLAMA_ARG_N_GPU_LAYERS_DRAFT
-md, --model-draft FNAME
推测解码草稿模型本地文件路径(默认不启用)
环境变量:LLAMA_ARG_SPEC_DRAFT_MODEL
--spec-type 类型列表
启用的推测解码算法,逗号分隔,可选:
none /draft-simple/draft-eagle3 /draft-mtp/draft-dflash /draft-dspark/ngram-simple /ngram-map-k/ngram-map-k4v /ngram-mod/ngram-cache
默认 none(关闭推测)
环境变量:LLAMA_ARG_SPEC_TYPE
--spec-ngram-mod-n-min N
Ngram-Mod 推测最小缓存 token 数量(默认 48)
--spec-ngram-mod-n-max N
Ngram-Mod 最大缓存 token(默认 64)
--spec-ngram-mod-n-match N
Ngram-Mod 匹配窗口长度(默认 24)
--spec-ngram-simple-size-n N
Ngram-Simple 查询 n 元组长度(默认 12)
--spec-ngram-simple-size-m N
Ngram-Simple 草稿 m 元组长度(默认 48)
--spec-ngram-simple-min-hits N
Ngram-Simple 最低匹配命中次数(默认 1)
--spec-ngram-map-k-size-n N
Ngram-Map-K 查询元组长度(默认 12)
--spec-ngram-map-k-size-m N
Ngram-Map-K 草稿元组长度(默认 48)
--spec-ngram-map-k-min-hits N
最低匹配次数(默认 1)
--spec-ngram-map-k4v-size-n / size-m / min-hits
四向向量 Ngram 映射参数,默认同上
已废弃参数提示
--draft / --draft-min / --spec-ngram-size-n/m/min-hits
参数已移除,替换为对应 spec-ngram 系列参数
场景专用参数 example-specific params
-lcs, --lookup-cache-static FNAME
静态查找缓存文件,检索解码使用,生成过程不更新缓存
-lcd, --lookup-cache-dynamic FNAME
动态查找缓存,生成时自动更新
-ctxcp, --ctx-checkpoints, --swa-checkpoints N
单个上下文槽位最大快照数量(默认 32)
参考:https://github.com/ggml-org/llama.cpp/pull/15293
环境变量:LLAMA_ARG_CTX_CHECKPOINTS
-cms, --checkpoint-min-step N
上下文快照最小间隔 token 数;0 无限制(默认 8192)
环境变量:LLAMA_ARG_CHECKPOINT_MIN_SPACING_NT
-cram, --cache-ram N
缓存最大占用内存(MiB);-1 无上限、0 关闭缓存(默认 8192)
参考:https://github.com/ggml-org/llama.cpp/pull/16391
环境变量:LLAMA_ARG_CACHE_RAM
-kvu, --kv-unified / --no-kv-unified
全局统一 KV 缓存缓冲区,多会话共享;自动并行槽位时默认开启
环境变量:LLAMA_ARG_KV_UNIFIED
--cache-idle-slots, --no-cache-idle-slots
新任务将空闲会话存入提示缓存,统一 KV 时自动清空;依赖 cache-ram(默认开启)
环境变量:LLAMA_ARG_CACHE_IDLE_SLOTS
--context-shift, --no-context-shift
无限生成启用上下文滑动窗口(默认关闭)
环境变量:LLAMA_ARG_CONTEXT_SHIFT
-r, --reverse-prompt PROMPT
交互式模式,检测到指定字符串即停止生成并交还控制台
-sp, --special
输出特殊 token 标识(默认关闭)
--warmup, --no-warmup
程序启动空跑预热模型计算(默认开启)
--spm-infill
填空任务使用 Suffix/Prefix/Middle 顺序,替代默认 Prefix/Suffix/Middle(默认关闭)
--pooling {none,mean,cls,last,rank}
嵌入向量池化策略;未指定使用模型默认配置
环境变量:LLAMA_ARG_POOLING
-np, --parallel N
服务端并发会话槽位数量;-1 自动适配(默认 – 1)
环境变量:LLAMA_ARG_N_PARALLEL
-cb, --cont-batching / -nocb, --no-cont-batching
连续动态批量调度(默认开启)
环境变量:LLAMA_ARG_CONT_BATCHING
-mm, --mmproj FILE
多模态视觉投影器文件路径;使用-hf拉取模型可自动下载无需手动指定
文档:tools/mtmd/README.md
环境变量:LLAMA_ARG_MMPROJ
-mmu, --mmproj-url URL
在线视觉投影器下载地址
环境变量:LLAMA_ARG_MMPROJ_URL
--mmproj-auto, --no-mmproj-auto
自动加载配套视觉投影文件(HF 模式默认开启)
环境变量:LLAMA_ARG_MMPROJ_AUTO
--mmproj-offload, --no-mmproj-offload
视觉投影器 GPU 硬件卸载(默认开启)
环境变量:LLAMA_ARG_MMPROJ_OFFLOAD
--image-min-tokens N
动态分辨率视觉模型,单张图片最小编码 token(默认读取模型配置)
环境变量:LLAMA_ARG_IMAGE_MIN_TOKENS
--image-max-tokens N
单张图片最大编码 token 上限(默认读取模型)
环境变量:LLAMA_ARG_IMAGE_MAX_TOKENS
--mtmd-batch-max-tokens N
图片编码批量总 token 上限(默认 1024)
环境变量:LLAMA_ARG_MTMD_BATCH_MAX_TOKENS
-a, --alias STRING
模型 API 别名,多别名逗号分隔
环境变量:LLAMA_ARG_ALIAS
--tags STRING
模型标签,仅用于展示不参与路由匹配,逗号分隔
环境变量:LLAMA_ARG_TAGS
--embd-normalize N
嵌入向量归一化方式
-1 = 关闭归一化
0 = 最大绝对值 int16 缩放
1 = 曼哈顿距离归一化
2 = 欧几里得归一化(默认)
2 = 自定义 P 范数
--host HOST
服务监听地址;以.sock 结尾则绑定 UNIX 本地套接字(默认 127.0.0.1)
环境变量:LLAMA_ARG_HOST
--port PORT
服务监听端口(默认 8080)
环境变量:LLAMA_ARG_PORT
--reuse-port
端口复用,允许多套接字绑定同一端口(默认关闭)
环境变量:LLAMA_ARG_REUSE_PORT
--path PATH
静态资源文件托管目录(默认空)
环境变量:LLAMA_ARG_STATIC_PATH
--cors-methods METHODS
跨域允许 HTTP 请求方法(默认 GET,POST,DELETE,OPTIONS)
环境变量:LLAMA_ARG_CORS_METHODS
--cors-headers HEADERS
跨域允许请求头,放行全部(默认)
环境变量:LLAMA_ARG_CORS_HEADERS
--cors-credentials, --no-cors-credentials
允许跨域携带 Cookie 凭证;默认开启,origins 为 * 时会原样回传 Origin 头
环境变量:LLAMA_ARG_CORS_CREDENTIALS
--api-prefix PREFIX
API 接口全局路径前缀,末尾不带斜杠(默认空)
环境变量:LLAMA_ARG_API_PREFIX
--ui-config, --webui-config JSON
WebUI 界面默认配置 JSON 字符串,覆盖内置默认值
环境变量:LLAMA_ARG_UI_CONFIG
--ui-config-file, --webui-config-file PATH
外部 JSON 文件配置 WebUI 参数
环境变量:LLAMA_ARG_UI_CONFIG_FILE
--ui-mcp-proxy, --no-ui-mcp-proxy
MCP 协议跨域代理(实验功能,不可在不可信公网开启,默认关闭)
环境变量:LLAMA_ARG_UI_MCP_PROXY
--tools TOOL1,TOOL2,...
启用内置 AI 工具代理(实验,公网勿开);传入 all 启用全部
可用工具:read_file、file_glob_search、grep_search、exec_shell_command、write_file、edit_file、get_datetime
安全限制:自动限制跨域仅localhost访问
环境变量:LLAMA_ARG_TOOLS
--mcp-servers-config PATH
MCP 服务定义 JSON 文件(Cursor 兼容格式,不可公网部署,默认无)
环境变量:LLAMA_ARG_MCP_SERVERS_CONFIG
--mcp-servers-json JSON
行内 JSON 定义 MCP 服务配置(同上安全限制)
环境变量:LLAMA_ARG_MCP_SERVERS_JSON
--ui, --webui, --no-ui
开启网页可视化界面(默认开启)
环境变量:LLAMA_ARG_UI
--embedding, --embeddings
仅启用嵌入向量接口,仅搭配专用 Embedding 模型使用(默认关闭)
环境变量:LLAMA_ARG_EMBEDDINGS
--rerank, --reranking
启用重排序 Rerank 接口(默认关闭)
环境变量:LLAMA_ARG_RERANKING
--api-key KEY
接口鉴权密钥,多密钥逗号分隔(默认无密钥)
环境变量:LLAMA_API_KEY
--api-key-file FNAME
密钥文件路径,每行一个密钥;# 开头行为注释(默认无)
环境变量:LLAMA_ARG_API_KEY_FILE
--ssl-key-file FNAME
PEM 格式 SSL 私钥文件路径
环境变量:LLAMA_ARG_SSL_KEY_FILE
--ssl-cert-file FNAME
PEM 格式 SSL 证书文件路径
环境变量:LLAMA_ARG_SSL_CERT_FILE
--chat-template-kwargs STRING
聊天模板解析附加参数,合法 JSON 对象字符串
示例:{"key1":"value1"}
环境变量:LLAMA_ARG_CHAT_TEMPLATE_KWARGS
-to, --timeout N
服务读写超时秒数(默认 3600)
环境变量:LLAMA_ARG_TIMEOUT
--sse-ping-interval N
SSE 流式心跳间隔秒;-1 关闭心跳(默认 30)
环境变量:LLAMA_ARG_SSE_PING_INTERVAL
--threads-http N
HTTP 请求处理线程数;-1 自动分配(默认 – 1)
环境变量:LLAMA_ARG_THREADS_HTTP
--cache-prompt, --no-cache-prompt
启用提示词 KV 缓存复用(默认开启)
环境变量:LLAMA_ARG_CACHE_PROMPT
--cache-reuse N
KV 滑动复用最小块尺寸,依赖 prompt 缓存(默认 0)
环境变量:LLAMA_ARG_CACHE_REUSE
--metrics
开启 Prometheus 监控指标接口(默认关闭)
环境变量:LLAMA_ARG_ENDPOINT_METRICS
--props
开放 POST /props 接口动态修改全局参数(默认关闭)
环境变量:LLAMA_ARG_ENDPOINT_PROPS
--slots, --no-slots
开放会话槽监控接口(默认开启)
环境变量:LLAMA_ARG_ENDPOINT_SLOTS
--slot-save-path PATH
会话 KV 缓存持久化保存目录(默认关闭持久化)
--media-path PATH
本地媒体文件加载目录,支持 file:// 相对路径访问(默认关闭)
--models-dir PATH
路由服务模型存放目录(默认关闭)
环境变量:LLAMA_ARG_MODELS_DIR
--models-preset PATH
路由模型预设 INI 配置文件(默认关闭)
环境变量:LLAMA_ARG_MODELS_PRESET
--models-max N
路由服务同时加载模型上限;0 无限制(默认 4)
环境变量:LLAMA_ARG_MODELS_MAX
--models-autoload, --no-models-autoload
路由服务自动加载目录内模型(默认开启)
环境变量:LLAMA_ARG_MODELS_AUTOLOAD
--jinja, --no-jinja
使用 Jinja2 引擎解析聊天模板(默认开启)
环境变量:LLAMA_ARG_JINJA
--reasoning-format FORMAT
思考推理标签解析格式
- none:思考内容保留在 message.content 不拆分
- deepseek:思考内容存入独立 message.reasoning_content 字段
- deepseek-legacy:保留标签同时拆分 reasoning_content
默认 auto 自动识别模板
环境变量:
LLAMA_ARG_THINK
-rea, --reasoning [on|off|auto]
推理思考模式开关;auto 自动读取模板配置(默认 auto)
环境变量:LLAMA_ARG_REASONING
--reasoning-budget N
思考阶段 token 预算;-1 无上限、0 直接结束思考、正数限制思考长度(默认 – 1)
环境变量:LLAMA_ARG_THINK_BUDGET
--reasoning-budget-message MESSAGE
思考 token 耗尽时插入的提示文本(默认空)
环境变量:LLAMA_ARG_THINK_BUDGET_MESSAGE
--reasoning-preserve, --no-reasoning-preserve
完整对话历史永久保存推理内容,不只保存在最后一轮助手回复;遵循模型模板能力标识
环境变量:LLAMA_ARG_REASONING_PRESERVE
--chat-template JINJA_TEMPLATE
内置 Jinja 聊天模板名称,覆盖模型自带模板;指定前缀 / 后缀会禁用模板
内置模板列表:bailing、bailing-think、bailing2、chatglm3、chatglm4、chatml、command-r、deepseek、deepseek-ocr、deepseek2、deepseek3、exaone-moe、exaone3、exaone4、falcon3、gemma、gigachat、glmedge、gpt-oss、granite、granite-4.0、granite-4.1、grok-2、hunyuan-dense、hunyuan-moe、hunyuan-vl、kimi-k2、llama2、llama2-sys、llama2-sys-bos、llama2-sys-strip、llama3、llama4、megrez、minicpm、mistral-v1、mistral-v3、mistral-v3-tekken、mistral-v7、mistral-v7-tekken、monarch、openchat、orion、pangu-embedded、phi3、phi4、rwkv-world、seed_oss、smolvlm、solar-open、vicuna、vicuna-orca、yandex、zephyr
环境变量:LLAMA_ARG_CHAT_TEMPLATE
--chat-template-file JINJA_TEMPLATE_FILE
外部文件自定义 Jinja 聊天模板,规则同上内置模板
环境变量:LLAMA_ARG_CHAT_TEMPLATE_FILE
--skip-chat-parsing, --no-skip-chat-parsing
强制纯文本解析,忽略 Jinja 模板;所有输出(推理、工具调用)全部放入 content 字段(默认关闭)
环境变量:LLAMA_ARG_SKIP_CHAT_PARSING
--prefill-assistant, --no-prefill-assistant
最后一条消息为助手回复时自动续写;关闭则视为完整消息不再预填充(默认开启)
环境变量:LLAMA_ARG_PREFILL_ASSISTANT
-sps, --slot-prompt-similarity SIMILARITY
会话复用提示词相似度阈值;0 关闭复用(默认 0.10)
--lora-init-without-apply
加载 LoRA 适配器但不立即生效,可通过 POST /lora-adapters 接口动态切换(默认关闭)
--sleep-idle-seconds SECONDS
空闲超时休眠秒数;-1 禁用休眠(默认 – 1)
--log-prompts-dir PATH
提示词日志保存目录(自动创建,仅调试用,默认关闭)
-mv, --model-vocoder FNAME
音频 TTS 声码器模型文件(默认不启用)
--tts-use-guide-tokens
TTS 语音生成启用引导 token 提升词语还原度
内置专用模型快捷参数(一键加载)
--embd-gemma-default
自动下载 Gemma 嵌入模型权重
--fim-qwen-1.5b-default
Qwen2.5-Coder 1.5B 代码补全模型
--fim-qwen-3b-default Qwen2.5-Coder 3B
--fim-qwen-7b-default Qwen2.5-Coder 7B
--fim-qwen-7b-spec Qwen7B 主模型 + 0.5B 草稿推测解码
--fim-qwen-14b-spec Qwen14B+0.5B 草稿
--fim-qwen-30b-default Qwen3 Coder 30B A3B 指令模型
--gpt-oss-20b-default / --gpt-oss-120b-default
自动下载对应 GPT-OSS 开源模型权重
--vision-gemma-4b-default / --vision-gemma-12b-default
Gemma3 4B/12B 视觉 QAT 量化模型
