v6 系列在 mm_struct 内新增 visited_cpus 位图与 epoch_last_visit,让 task_cache_work 只扫描最近 llc_epoch_affinity_timeout 内真正跑过本 mm 的 CPU;在 384 CPU 多 NUMA 平台上把 task_cache_work 的 cycles 占比从 0.81% 降到 0.02%,Redis p99 延迟退化从 25.68% 收敛到 1.14%。v6 同时把 cpumask 改为 cpumask_var_t 动态分配,直接与 LLC span 取交集防跨节点遗漏,并把 __update_mm_sche...
v6 系列在 mm_struct 内新增 visited_cpus 位图与 epoch_last_visit,让 task_cache_work 只扫描最近 llc_epoch_affinity_timeout 内真正跑过本 mm 的 CPU;在 384 CPU 多 NUMA 平台上把 task_cache_work 的 cycles 占比从 0.81% 降到 0.02%,Redis p99 延迟退化从 25.68% 收敛到 1.14%。v6 同时把 cpumask 改为 cpumask_var_t 动态分配,直接与 LLC span 取交集防跨节点遗漏,并把 __update_mm_sched 前移到 timeout 检查之前以消除 race;附带的 SC_VISIT/trace 调试 patch 仅用于 A/B 测试,明确标注 DO NOT APPLY。