﻿====================
人工输入（2026-01-16）

我的windows11电脑遇到了一个非常偶发的卡死问题，接下来你需要和我一起尝试定位解决这个问题。你需要把你的发言也记录在这篇文档内，以便后续查阅。
以下是我遇到的问题以及我尝试过的解决方案
我的电脑是一台联想拯救者刃9000k 2023，搭载RTX 4090, i9-13900KF
最近半年左右，电脑会偶发的出现黑屏卡死的问题。表现为，从睡眠/休眠/息屏状态下敲击键盘或者移动鼠标尝试唤醒的时候，有一定概率会卡在正在锁定的界面上。此时画面会完全卡死，双屏显示器中，主显示器卡在正在锁定的转圈界面，副显示器直接失去信号输入。
此时，键盘的Caps Lock键是没有反应的（正常状态下Caps Lock键应该按下以后会显示是否开启大写锁定，所以我认为这可能是一个重要的信号，但我不知道这意味着什么）
在这个状态下如果我不做任何操作，电脑上安装的机械硬盘持续仍然在工作，风扇也在转，但是不会有任何响应，直到等待5-10分钟会自动重启，或者我长按电源键可以强制重启。
在强制重启完成以后查看windows事件查看器，找不到任何有用的信息，只能看到一个非正常关机的报错。
我当前尝试过的操作包括：
1. 关闭了快速启动
2. 把我的windows版本更新到了最新版本
3. 重装了电源管理驱动
4. 在卡死状态下通过长按win+ctrl+shift+B尝试重启显卡驱动，没有成功

在卡死状态下，尝试通过windows自带的远程桌面进入系统，会一直卡在正在配置远程电脑这一步，看起来像是初始的网络连接已经建立成功，但是电脑在某个阶段没有响应导致一直卡在这里。我之前遇到过一次，还没有卡死的情况下直接远程到这台电脑，成功建立远程连接，然后我关闭远程连接，尝试将其从息屏状态下唤醒，就卡死了，然后再尝试远程桌面，就卡在配置远程电脑这一步了

因为这个卡死是一个偶发的问题，我也不能100%复现，所以非常头疼，我需要你的帮助
====================
AI记录（2026-01-22）

已阅读当前文档内容：目前记录仅包含 2026-01-16 的一次人工描述与已尝试措施。现问题“刚刚又出现一次”，但文档尚未记录本次复现的时间点、当时电源状态（睡眠/休眠/仅息屏）、以及是否有新增的系统日志/症状。

初步判断要点（基于已有描述）：
1) “Caps Lock 无反应”通常意味着系统在更底层已失去调度（可能为内核/驱动级卡死），而不仅是图形界面假死；也可能是输入堆栈/中断被阻塞。
2) 副屏无信号 + 主屏停在锁屏转圈，且 Win+Ctrl+Shift+B 无法恢复，提示可能涉及：显卡驱动/显示链路在唤醒路径失败、Modern Standby/睡眠唤醒路径中的设备电源状态切换异常、或某个内核驱动死锁。
3) 远程桌面“正在配置远程电脑”卡住，说明网络握手可能建立，但目标机在登录/会话初始化阶段无响应（与系统级卡死一致）。

下一步目标：把“偶发”变成“可定位”，优先收集一次卡死前后 5~10 分钟的可关联证据。

A. 立刻补充的记录项（请在每次发生后追加到本文档）
- 发生时间（精确到分钟）
- 发生前状态：睡眠/休眠/仅关闭显示器/锁屏后待机（以及持续了多久）
- 唤醒方式：键盘/鼠标/电源键/定时器/网络唤醒
- 现象细节：主屏内容、分辨率是否变化、副屏是“无信号”还是黑屏有背光
- 机器指示：键盘灯、NumLock/CapsLock、机箱电源灯、硬盘灯、风扇转速是否明显变化
- 是否插拔过外设/USB扩展坞/VR设备/采集卡等

B. 建议立刻做的“取证型设置”（为下一次复现做准备）
1) 启用/检查系统转储（用于驱动/内核死锁分析）
   - 系统属性 → 启动和故障恢复：写入调试信息建议至少“自动内存转储”（或“内核内存转储”）。
   - 确认页面文件存在且足够（通常需位于系统盘）。
2) 可靠性监视器定位崩溃/硬件错误线索
   - 查看“可靠性历史记录”，重点关注：Windows 错误报告、硬件错误（WHEA）、显示驱动重启等。
3) 事件查看器重点频道（下次按时间点回溯）
   - Windows 日志：系统（Kernel-Power 41、BugCheck、Display、WHEA-Logger）
   - 应用程序和服务日志：Microsoft-Windows-Kernel-PnP/Configuration、Power-Troubleshooter
4) 生成/保存电源与唤醒报告（事后分析用）
   - powercfg /systemsleepdiagnostics（睡眠诊断）
   - powercfg /sleepstudy（如果设备支持 Modern Standby）
   - powercfg /lastwake（最近一次唤醒来源）

C. 下一次卡死时（在保证安全前提下）可尝试的操作（按优先级）
1) 等待 60~120 秒观察是否自动恢复（某些驱动超时会自行回滚）。
2) 若键盘仍有响应：尝试 Ctrl+Alt+Del（看是否能切到安全桌面）。
3) 仍无反应：记录现象后再强制重启（避免反复硬断电）。

D. 需要你立刻回答的 6 个关键问题（用于缩小范围）
1) “刚刚那次”发生前，电脑处于：睡眠/休眠/仅息屏/锁屏？
2) 你是否使用了 HDR、G-Sync/VRR、多显示器不同刷新率（例如 4K144 + 2K60）？
3) 显示器连接方式：HDMI/DP？是否有 DP 线材/转接头/延长线？
4) BIOS 与显卡驱动版本（大概即可），以及是否开启了 HAGS（硬件加速 GPU 调度）？
5) 是否开启了“允许网络唤醒/USB唤醒/快速启动/现代待机”中的任何一项（快速启动已关闭，其他待确认）？
6) 强制重启后，“可靠性监视器”在对应时间点是否出现硬件错误或显示驱动相关条目？

（后续计划）
- 若能拿到一次 BugCheck/转储文件：优先走“驱动/死锁”方向。
- 若完全没有 BugCheck 且仅 Kernel-Power 41：优先走“睡眠唤醒链路/BIOS/显示链路/电源策略”方向，并通过 powercfg 报告与事件日志交叉验证。
====================

====================
人工输入（2026-01-22）
刚刚的这次卡死，
A.
- 发生在2026年1月22日晚上20点28分。
- 发生前的状态是正在从休眠中唤醒，之前休眠了大约24小时。
- 唤醒的方式是通过电源键。
- 主副屏分辨率都没有发射变化。副屏幕是亮起来了一小下，然后就变成无信号输入了。主屏出现了正在锁定的转圈，但是连转圈都卡死了
- 键盘灯亮起，CapsLock键没有反应，机箱电源灯常亮，硬盘灯持续闪烁，风扇转速没有明显变化
- 没有插拔过任何外设

B.
1) 系统转储已经启用，设置为自动内存转储
2) 可靠性历史记录中记录了如下信息：
<Event>
<Time>2026-01-22T20:31:28.420</Time>
<Impact>关键</Impact>
<Source>Windows</Source>
<Problem>Windows 停止工作</Problem>
</Event>
<Event>
<Time>2026-01-22T20:31:29.531</Time>
<Impact>关键</Impact>
<Source>Windows</Source>
<Problem>Windows 未正常关闭</Problem>
</Event>
3) 事件查看器节选以下记录：
2026/1/22 20:26:40 信息 系统启动时间为 413599 秒。
2026/1/22 20:26:41 警告 发生了已更正的硬件错误。 组件: PCI Express Root Port 错误源: Advanced Error Reporting (PCI Express)
2026/1/22 20:26:41 信息 系统会话已从10转换为 11. 原因 SxTransition  BootId： 32
2026/1/22 20:26:42 警告 NtpClient 无法将手动对等机设置为用作时间源，因为“time.windows.com,0x9”上出现 DNS 解析错误。NtpClient 将在 15 分钟后重试，此后重试间隔增加一倍。错误为: 不知道这样的主机。 (0x80072AF9)
2026/1/22 20:26:43 信息 系统会话已从11转换为 13.
2026/1/22 20:27:53 错误 服务器 Microsoft.YourPhone_1.25112.36.0_x64__8wekyb3d8bbwe!App.AppXn958k7nsj8mxxmsepqdam8xk948t30sc.mca 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:27:53 错误 服务器 Microsoft.BingWeather_4.54.63029.0_x64__8wekyb3d8bbwe!App.AppXydmptpzm8pts0mhzrytvzy52ye9x3ttq.mca 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:27:53 错误 服务器 Microsoft.WindowsStore_22511.1401.6.0_x64__8wekyb3d8bbwe!App.AppXbes12ecwhvvewxbmkmnasc9amnxfsx1c.mca 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:27:53 错误 服务器 Microsoft.WindowsFeedbackHub_1.2512.16303.0_x64__8wekyb3d8bbwe!App.AppX8a6w88secebzyje9nrqc47xt488tkbmc.mca 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:27:53 错误 服务器 Microsoft.XboxGamingOverlay_7.325.11061.0_x64__8wekyb3d8bbwe!App.AppXpa8c6rgd3yzmnwb7kznbz0y2c2tmedk3.mca 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:27:53 错误 服务器 MicrosoftWindows.Client.OOBE_1000.26100.28.0_x64__cw5n1h2txyewy!OobeHost.AppX57bnpdhb2y2keeh7gnjg18wys2747njp.mca 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:28:18 错误 服务器 {338B40F9-9D68-4B53-A793-6B9AA0C5F63B} 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:29:51 信息 NIC C08CB7B8-9B3C-408E-8E30-5E16A3AEB445 successfully disconnected from port .
2026/1/22 20:29:53 错误 服务器 Microsoft.AAD.BrokerPlugin_1000.19580.1000.2_neutral_neutral_cw5n1h2txyewy!Windows.Security.Authentication.Web.Core.BackgroundGetTokenTask.ClassId.WebAccountProvider 没有在要求的超时时间内向 DCOM 注册。
2026/1/22 20:31:12 信息 操作系统已在系统时间 2026-01-22T12:31:11.500000000Z 启动。
2026/1/22 20:31:28 错误 计算机已经从检测错误后重新启动。检测错误: 0x00000133 (0x0000000000000001, 0x0000000000001e00, 0xfffff801d8bc43b0, 0x0000000000000000)。已将转储的数据保存在: C:\WINDOWS\Minidump\012226-17125-01.dmp。报告 ID: 2d9c5441-44b1-4552-a0ea-3ff739039cbd。

注意：012226-17125-01.dmp文件我已经保存到同目录下了。
4)
- powercfg /systemsleepdiagnostics: 系统睡眠诊断报告已弃用且替换为系统电源报告。请改用命令 "powercfg /systempowerreport"。
- powercfg /systempowerreport: 已生成报告，保存到了同目录下的sleepstudy-report.html
- powercfg /sleepstudy: 已生成报告，保存到了同目录下的sleepstudy-report.html
- powercfg /lastwake: 唤醒历史记录计数 - 0

C.
1) 这次卡死后我一直等待，系统自动重启了，然后正常进入了系统
2) 键盘完全没有任何响应

D.
1) 电脑处于休眠状态
2) 没有使用HDR，G-Sync/VRR，多显示器不同刷新率
3) 显示器连接方式是主显示器通过DP连接，副显示器通过HDMI连接，没有使用任何转接头
4) BIOS版本是最新的，显卡驱动版本是581.57，开启了HAGS
=====================

====================
AI记录（2026-01-22）
我已读到你在文档里补充的 2026-01-22 这次复现细节与日志，关键信息很明确了：
触发路径：休眠 24 小时 → 按电源键唤醒 → 卡在“正在锁定”转圈且转圈也停住；副屏短暂亮后变为无信号；键盘完全无响应（Caps/Num 都不行）。
结果：你这次没硬重启，而是系统随后自动重启。
事件里最重要的一条是：BugCheck 0x00000133，并且已生成小转储：C:\WINDOWS\Minidump\012226-17125-01.dmp（你已拷贝到工作目录同级）。
同一时间段还出现：“已更正的硬件错误：PCI Express Root Port / AER”（这是非常有价值的线索）。
powercfg /lastwake 为 0（不意外：休眠恢复路径+非正常重启后，lastwake 往往拿不到可用记录）。
你还确认：NVIDIA 581.57 + HAGS 开启，无 HDR/G-Sync/VRR，主 DP 副 HDMI，无转接头。
基于这些，我的判断优先级变了：这已经不只是“黑屏卡死”，而更像 休眠恢复过程中某个驱动在高 DPC/ISR 下卡死或超时，最终触发 DPC_WATCHDOG_VIOLATION（0x133）。同时出现的 PCIe Root Port AER 更正错误提示：可能存在 PCIe 链路在低功耗/唤醒转换时不稳定（常见相关方：显卡/主板 PCIe、某些 NVMe、以及电源管理/BIOS/ASPM）。
接下来我建议走“两条线并行”，但都尽量做“可回退、改动小”的验证：
1) 先把转储分析出来（定性：到底卡在哪个驱动）
你已经有 012226-17125-01.dmp，这是最关键证据。下一步我可以在你这个工作区里做自动化解析，但需要先确认你希望用哪种方式：
如果你机器上已装 WinDbg（预览版/商店版），我们可以直接用它出 !analyze -v 结果；
如果没装，我也可以帮你在文档里生成一套最短安装与分析流程（不需要你手动猜命令）。
为了避免你来回复制粘贴，我建议：我来直接在工作区新增一个 “dump 分析脚本/README”，把步骤固化下来。你确认后我就做。
2) 同时做 2 个最小化“排除项”（不改硬件、不大动系统）
这两个改动的目的：验证是不是“GPU 调度/休眠恢复链路”导致的 0x133。
A. 先关闭 HAGS（强烈建议先试） 你已确认 HAGS 开启；HAGS 在部分驱动版本+多显示器+休眠恢复组合下，确实更容易触发卡死/0x133（不是必现，但与你现象吻合）。
验证方式：仅关闭、重启、观察下一次休眠唤醒。
B. 暂时禁用休眠（只为验证链路），改用“睡眠/仅息屏”一段时间 因为这次明确发生在“休眠恢复”。如果禁用休眠后现象明显消失，就能把范围锁在“hiber + 驱动恢复路径”。
这不一定是最终方案，但对定位很有用。
你日志里另一条关键：PCIe Root Port AER “已更正”错误
这类错误即使“已更正”，也常常意味着链路质量/省电策略/设备固件存在抖动。后续我们会重点看：
错误对应的 设备实例路径/端口号（事件详情里能看到具体 Root Port，能映射到某个 PCIe 设备）
Sleepstudy 报告里是否出现某个设备在进入/退出低功耗时异常（你给我的 html 目前只读到开头样式部分，还没读到数据段；需要我继续往下定位“设备/会话/错误”章节）
我需要你补 2 个信息（都跟“PCIe/AER”和“dump 定位”强相关）
事件查看器里那条“PCI Express Root Port / AER”的事件详情（复制“常规”里更完整内容，尤其是端口/总线/设备/功能号，或“设备实例路径”字段）。
你是否愿意让我接下来直接读取并分析工作区里的 copilot_workspace/repair/012226-17125-01.dmp，然后把分析结论追加写回记录文档（会包含可能的“故障模块/驱动名”与建议下一步）。
只要 dump 能指向具体驱动（例如显示、存储、网卡、某个滤镜驱动），我们就能把排查从“猜”变成“改动—验证—收敛”。
====================

====================
AI记录（2026-01-22）- WinDbg分析结论（012226-17125-01.dmp）

用户提供的 WinDbg `!analyze -v` 关键结论：
- BugCheck：0x133 DPC_WATCHDOG_VIOLATION
  - P1=1（系统累计在 DISPATCH_LEVEL 或更高 IRQL 停留时间过长）
  - DPC_TIMEOUT_TYPE：DPC_QUEUE_EXECUTION_TIMEOUT_EXCEEDED
- Failure.Bucket：`0x133_ISR_nvlddmkm!unknown_function`
- 栈：在时钟中断/ISR 路径内触发，顶层第三方模块为 `nvlddmkm.sys`（NVIDIA 显卡内核驱动）
- 提示信息：`*** WARNING: Unable to verify timestamp for nvlddmkm.sys`
  - 这通常不等同于“驱动必然损坏”，常见原因包括符号/时间戳验证不可用；但结合栈与 Bucket，显卡驱动在 ISR/DPC 路径异常超时的可能性很高。
- 环境：Hypervisor 标志为 1（系统启用了 Hyper-V/虚拟化相关能力；可能来自 Hyper-V、WSL2、VBS/内存完整性等）。

基于上述结论的优先排查顺序（从“改动最小、收益最大”开始）：

1) 立即关闭 HAGS（硬件加速 GPU 调度）并复测
- 你的环境此前已确认 HAGS=开启；0x133 + nvlddmkm ISR 的组合下，优先把 HAGS 作为第一可回退变量。
- 目标：观察“休眠→唤醒”在相同使用场景下是否不再触发卡死/自动重启。

2) 显卡驱动做一次“干净重装”或回退一个稳定版本
- 当前版本：NVIDIA 581.57。
- 建议路径：
  - A) 先尝试回退到一个你历史上稳定的 WHQL 版本（减少回归风险）。
  - B) 或使用 DDU（安全模式）做一次完全卸载后再安装（可排除升级残留/组件损坏）。
- 同时建议暂时禁用：GeForce Experience Overlay / Xbox Game Bar / 第三方叠加层（只作为验证变量）。

3) 检查虚拟化相关功能（Hyper-V / VBS）对显示驱动路径的影响（仅做验证）
- WinDbg 显示 Hypervisor.AnyHypervisorPresent=1。
- 若你确实启用了 Hyper-V/WSL2/内存完整性(VBS/HVCI)：
  - 建议选择一个窗口期做 A/B Test：临时关闭其中一项（尤其是“内存完整性/核心隔离”）后复测“休眠→唤醒”。
  - 目的：排除虚拟化安全特性对 GPU 调度/中断路径的放大效应。

4) 结合此前事件中的 “PCIe Root Port / AER 已更正硬件错误” 做链路侧验证
- 0x133 指向表现层（nvlddmkm ISR/DPC 超时），AER 指向底层链路（PCIe 纠错）。两者可同源：唤醒时 PCIe 链路抖动→驱动 ISR/DPC 被拖死。
- 建议：
  - 在 BIOS/电源计划中，优先检视与 PCIe 省电相关选项（如 ASPM/Link State Power Management）。先“仅做一次调整并复测”，避免多变量同时变化。
  - 下一次出现 AER 时，把事件查看器中该条目的“详细信息”（端口/总线/设备/功能号）记录下来，以便映射到具体设备（GPU/NVMe/网卡等）。

5) 若仍复现：升级取证等级
- 将转储类型从“小型转储”提升为“内核内存转储”（若当前并非内核转储），以便拿到更完整的 DPC/ISR 上下文（代价是 dump 更大）。
- 若能稳定抓到更完整 dump，再根据 `!analyze -v`、`lmvm nvlddmkm`、以及相关黑盒（blackboxpnp/winlogon/ntfs）进一步收敛。

（当前阶段结论）
- 这次卡死/自动重启并非“纯黑屏无日志”，而是已明确落到：`0x133 + nvlddmkm.sys ISR/DPC 超时`。
- 因此后续排查应优先围绕：HAGS/驱动版本与安装完整性/叠加层/虚拟化安全特性/PCIe 省电与链路稳定性。

====================
人工输入（2026-01-22）
- 已关闭 HAGS（硬件加速 GPU 调度），准备观察对“休眠→唤醒”卡死/0x133 的改善效果。
====================
AI记录（2026-01-22）- 关闭 HAGS 的影响与验证方案

关闭 HAGS 可能带来的影响（总体：更保守、更兼容）：
1) 性能/延迟：
   - 大多数日常使用无感。
   - 少部分游戏/高帧率场景可能出现极小的延迟上升或帧时间波动变化，也可能完全无差异。
2) 稳定性：
   - 在本案已明确为 `0x133_ISR_nvlddmkm`（显卡驱动 ISR/DPC 超时）的前提下，关闭 HAGS 属于高收益、低风险的 A/B 验证变量，目标是降低休眠唤醒路径触发概率。
3) 兼容性：
   - 不影响显卡基本功能、多屏、分辨率/刷新率设置；属于可随时回退的系统级开关。

验证方式（建议固定变量，避免混杂）：
- 在驱动版本、外设、显示模式不变的情况下，复测“长时间休眠（例如隔夜）→电源键唤醒”若干次。
- 若再次出现卡死/自动重启：
  - 记录发生时间点；
  - 检查是否再次生成 0x133 dump；
  - 同步查看是否仍伴随 PCIe Root Port/AER 的“已更正硬件错误”。

回退与下一步：
- 若关闭 HAGS 后明显改善：维持关闭状态，并继续观察一段时间确认稳定。
- 若关闭 HAGS 后仍复现：进入下一优先级——显卡驱动“干净重装/回退稳定版”（必要时 DDU），并考虑临时关闭叠加层与虚拟化安全特性做 A/B Test。

====================
人工输入（2026-02-14）
- 今天又一次出现了类似的错误。
- 上一次因为等不下去直接强制重启，因此没有产生新的 .dmp 文件。
- 这一次等待系统自己重启，已产生新的 .dmp 文件（待进一步分析定位）。
- 已确认 HAGS（硬件加速 GPU 调度）已经关闭。
- 下一步：继续分析新产生的 dmp 与相关日志。
====================

====================
AI记录（2026-02-14）- 本轮取证计划（等待用户提供日志分析结果）
1) 先固化证据：
   - 新生成的 dmp 文件请复制/保存到工作区（建议放在：copilot_workspace/repair/ 目录），并记录原始路径（通常为：C:\Windows\Minidump\*.dmp 或 C:\Windows\MEMORY.DMP）。
   - 同步记录本次复现的关键信息：发生时间、触发前电源状态（睡眠/休眠/息屏）、唤醒方式、是否多显示器、是否出现 PCIe Root Port/AER 已更正硬件错误、是否出现 BugCheck 事件。
2) 为避免“强制重启导致无 dmp”：
   - 若再次卡死且可以等待，尽量等待系统自动重启（或触发蓝屏）以生成转储。
3) 待用户提供：
   - 新 dmp 的 WinDbg `!analyze -v` 结果（或把 dmp 放到工作区我来解析）。
   - 事件查看器中对应时间窗口（前后 10 分钟）的关键条目：BugCheck、WHEA-Logger、Display、Kernel-Power、PCIe/AER。
====================

====================
AI记录（2026-02-14）- WinDbg分析结论（021426-11890-01.dmp）
用户提供的 WinDbg `!analyze -v` 关键结论：
- FILE_IN_CAB：021426-11890-01.dmp
- BugCheck：0x133 DPC_WATCHDOG_VIOLATION
  - P1=1（系统累计在 DISPATCH_LEVEL 或更高 IRQL 停留时间过长）
  - P2=0x1e00（watchdog 周期 tick）
  - DPC_TIMEOUT_TYPE：DPC_QUEUE_EXECUTION_TIMEOUT_EXCEEDED
- Failure.Bucket：`0x133_ISR_nvlddmkm!unknown_function`
- 堆栈：在时钟中断/ISR 路径内触发，第三方栈顶持续指向 `nvlddmkm.sys`（NVIDIA 显卡内核驱动）
  - 本次偏移：`nvlddmkm+0x267e6a`（同时栈中出现 `nvlddmkm+0x168495` 等）
- 仍出现提示：`*** WARNING: Unable to verify timestamp for nvlddmkm.sys`
- Hypervisor 标志仍为 1（RootFlags.IsHyperV=1）：系统处于启用 Hyper-V/虚拟化相关能力状态（可能来自 Hyper-V、WSL2、VBS/内存完整性 等）。

与 2026-01-22 的对比结论：
- 即使已关闭 HAGS，本次依然复现同类 0x133，并且 Bucket 仍为 nvlddmkm ISR 超时。
- 说明 HAGS 不是唯一触发条件；需要把排查重点转向：显卡驱动安装/版本、叠加层与内核组件、虚拟化安全特性、以及 PCIe 链路/省电策略（与先前 AER 线索可能同源）。

下一步建议（按优先级，尽量一次只改一个变量）：
1) 显卡驱动“干净重装/回退稳定版”（优先级最高）
   - 使用 DDU（安全模式）彻底卸载 NVIDIA 驱动后重装。
   - 若当前为较新分支版本：建议回退到一个更成熟的 WHQL 版本做 A/B（以稳定为目标）。
   - 同时禁用可能注入/叠加的组件做验证：GeForce Experience Overlay、Xbox Game Bar、Discord/Steam/NVIDIA overlay、录屏/监控类工具（只作为排除变量）。
2) 虚拟化相关能力做 A/B 验证（针对 Hypervisor 标志=1）
   - 若你开启了“内存完整性/核心隔离（HVCI）”、Hyper-V、WSL2：选择其中一项在可控窗口期临时关闭后复测“休眠→唤醒”。
   - 目的：验证虚拟化/安全内核是否放大了 GPU ISR/DPC 触发概率。
3) 继续跟踪 PCIe/AER（若事件里仍出现“PCI Express Root Port / AER 已更正硬件错误”）
   - 把对应事件的“详细信息”记录下来（总线/设备/功能号/设备实例路径），用于映射到具体硬件（GPU/NVMe/网卡等）。
   - 后续再决定是否调整 PCIe 省电策略（ASPM/Link State Power Management）做验证。
4) 提升转储取证能力（若仍频繁复现）
   - 将转储类型调整为“内核内存转储”（或完整内存转储），以便拿到更完整的 DPC/ISR 上下文与相关对象信息（代价：dump 文件更大）。

待补充信息（用于下一轮收敛）：
- 本次复现发生前的电源状态：睡眠/休眠/仅息屏？持续多久？唤醒方式？
- 本次对应时间窗口是否仍有 WHEA-Logger / PCIe Root Port AER 的日志（若有请粘贴事件详情）。
====================

====================
人工输入（2026-02-14）- 补充：触发条件 & 事件日志
- 本次复现前：从“休眠”状态唤醒。
- 唤醒方式：电源键。

事件查看器摘要：
1) 11:31:47 警告：发生了已更正的硬件错误（AER）
   - 组件：PCI Express Root Port
   - 错误源：Advanced Error Reporting (PCI Express)
   - 主总线:设备:函数：0x0:0x1C:0x4
   - 辅助总线:设备:函数：0x0:0x0:0x0
   - 主要设备名称：PCI\VEN_8086&DEV_7A3C&SUBSYS_376A17AA&REV_11
2) 11:33:38 错误：nvlddmkm 事件 ID 153（本机缺少描述/消息表）
   - \Device\00000244
   - Resetting TDR occurred on GPUID:100
3) 11:38:00 错误：系统意外关机（上一次 11:35:55）
====================

====================
AI记录（2026-02-14）- 组合证据解读 & 下一步收敛
本次新增的关键点在于：
- 休眠唤醒路径中先出现 PCIe Root Port 的 AER“已更正硬件错误”（指向 PCIe 链路/电源状态切换抖动）。
- 随后出现 nvlddmkm 的 TDR 重置记录（GPU 超时检测与恢复），并且 dump 里仍然是 0x133 ISR nvlddmkm。
=> 这三者组合更像“GPU 在唤醒/链路恢复阶段出现响应异常（可能被 PCIe 链路错误/省电策略放大）→ 触发 TDR → 最终在 ISR/DPC 路径上超时导致 0x133”。

下一步建议（只改一项就复测，避免混杂变量）：
1) 优先：NVIDIA 驱动做一次 DDU 干净重装 + 回退到稳定 WHQL 版本做 A/B
   - 目标：排除驱动升级残留/组件损坏，并验证是否为特定分支回归。
2) 叠加层/注入类组件最小化（仅作为验证变量）
   - 临时关闭：NVIDIA/GeForce Experience Overlay、Xbox Game Bar、以及常见第三方 Overlay/监控/录屏（如有）。
3) 虚拟化/安全内核 A/B（dump 中 Hyper-V 标志一直为 1）
   - 若启用了“内存完整性(HVCI)/核心隔离”、Hyper-V、WSL2：选一项在可控窗口期临时关闭复测。
4) PCIe 省电策略验证（基于 AER Root Port 线索）
   - Windows 电源计划中把“PCI Express → 链路状态电源管理”临时设置为“关闭”做 A/B。
   - BIOS 中若存在 ASPM/PCIe 电源相关选项，可在确认当前值后，仅改动一次做验证。

需要进一步补齐的定位信息（用于把 AER Root Port 映射到具体设备）：
- 请补充该 AER 事件的“详细信息”完整 XML（或至少包含：Port/Device Instance Path/Segment/Bus/Device/Function 的字段），以便确认该 Root Port 下挂设备是不是 GPU（或 NVMe/网卡等）。
- 另外建议在 WinDbg 中对该 dump 执行：`lmvm nvlddmkm`（记录驱动具体版本/时间戳信息，避免仅凭版本号猜测）。
====================
