Skip to content

fix(rank): 看图把关候选编号统一(3B 视觉模型 1/5 → 4/5)+ 可选本机 Ollama 视觉模型 - #22

Merged
jnMetaCode merged 1 commit into
mainfrom
fix/rank-index-base
Sep 22, 2026
Merged

jnMetaCode merged 1 commit into
mainfrom
fix/rank-index-base

Conversation

@jnMetaCode

Copy link
Copy Markdown
Owner

两件事

  1. 候选编号打架(对所有模型都是隐患):提示词写"候选 0:[图片1]"——候选从 0 起、引擎留的图片占位从 1 起。本机 3B 视觉模型真机 3 选 1 只对 1/5:它按 1 起回 i,第 1 条候选永远被解析成 0 分。现在候选从 1 起编号,解析兼容仍按 0 起数的模型(出现 i=0 就按 0 起)。同一模型同一批 12 张缓存图:1/5 → 4/5。单测 + 变异检查。
  2. 看图把关可选本机 Ollama 视觉模型:型号只列名字带 vl / llava / vision 的。至此写脚本 + 看图 + 出图三步都能 0 key 全本机。依赖 AO 的 ollama 连接器改动(AO 仓本地分支 feat/ollama-vision,未推):以前剥掉图片,现在走 images 字段,并把图片算进 num_ctx(真机 12 张缩略图只按文本估 4096 → Ollama 400)。旧引擎下"验证并开启"真发一张红图,会如实报看不了图,不会假通过。

真机(qwen2.5vl:3b,AO 补丁临时放进 node_modules 验的,验完还原)

  • 纯色红/蓝/绿图全答对;界面"验证并开启" ✅;选纯文本型号 → Ollama 400 "does not support multimodal",如实显示
  • openshorts run --vision-provider ollama --only s1:一镜从"本机出图 56 秒"变成"本机看图选中素材 44 秒"
  • 但 3B 给了一张满是文字的示意图 7 分(提示词要求 ≤ 2)——模型判断力上限,界面提示建议 ollama pull qwen2.5vl:7b(7B 未验,要再下 6 GB)

全量测试通过、构建通过。

提示词里"候选 0:[图片1]"两套编号打架,本机 3B 视觉模型 3 选 1 只对 1/5(第 1 条永远算 0 分);统一后 4/5。
ollama 进看图把关的供应商列表,型号只列本机能看图的(需引擎 ≥ 0.19.3 把图真发出去;旧引擎验证会如实报看不了图)。
@jnMetaCode
jnMetaCode merged commit d1d4db9 into main Sep 22, 2026
8 checks passed
@jnMetaCode
jnMetaCode deleted the fix/rank-index-base branch September 22, 2026 13:52
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant