论文解读|LLM 引导 MAP-Elites 进化:在医疗决策工作流中击败手动设计

本周 arXiv 一篇把「LLM + 进化算法」玩出花的论文:2606.07342,来自俄罗斯 Skoltech + AIRI 团队。LLM-Guided Evolution for Medical Decision Pipelines 把 LLM 当作「代码进化器」,在三个真实医疗任务上击败了人工设计的方法。

核心方法:LLM 引导的 MAP-Elites

MAP-Elites 是一种「质量多样性」进化算法,传统用在机器人/游戏 AI。这里:

  1. 维护一个「精英程序库」(MAP-Elites archive)
  2. 每轮用 LLM 对当前程序做「变异+重组」,生成候选程序
  3. 每个候选在特定 fitness 函数下评估(任务专属)
  4. 进入 archive 的不同「格子」(按行为特征划分)

关键创新:LLM 引导的变异更「有意义」——它理解程序语义、保留合理结构、只改关键部分,不是随机字符替换。

三个医疗场景的胜利

  • 急诊分诊(triage):在 Semigran 数据上,accuracy 从 77.3% → 87.1%,紧急召回从 0.60 → 0.97。在 MIMIC-ESI 上 safety-weighted 表现也更好
  • 交互问诊(consultation):在 Llama-3 / Qwen-3.5 / Gemma-4 上 accuracy-cost 前沿全面优于手动 prompt;可迁移到 iCRAFTMD 跨域数据
  • 医学影像分类(PneumoniaMNIST):仅靠 prompt 进化的 frozen MedGemma VLM 提升明显,且严格保持 JSON 输出格式

可解释性分析(最值得看的部分)

作者对进化出来的程序做了定性分析,发现提升来自可解释的程序级机制

  • 校准的分诊边界:不再是固定阈值,而是按症状严重度滑动
  • 定向证据获取:主动问最关键的 1-2 个问题(而不是模板化的 5-10 问)
  • 选择性承诺:低置信度时不硬下结论,要求补充信息
  • 面向发现的视觉决策规则:MedGemma 进化出的 prompt 关注 X-ray 上「密度+边缘」特征,而不是背景像素

对企业 AI 团队的启示

这种「LLM-as-Evolver」模式可以低成本地应用到任何「决策管道」任务:

  • 金融风控的拒赔/通过规则
  • 电商客服的分流和应答策略
  • 法律合同审查的关注点排序
  • 工业质检的多模态决策

不需要 GPU 训练大模型,只需要一个能写代码的 LLM(GPT-4 / Claude / DeepSeek)就能跑。

代码开源:github.com/univanxx/llm_guided_evo_medical

Leave a Comment