一聚教程网:一个值得你收藏的教程网站

热门教程

Oracle RAC RU升级后集群异常怎么办-操作步骤和注意点

时间:2026-08-27 10:02:48 编辑:袖梨 来源:一聚教程网

放在具体场景中,把先确认 ohasd 是否存活,别碰 crsctl start crs、profile4downgrade.xml 权限错误:11g 升级 19c 后最隐蔽的 RU 坑、transparent_hugepage 未禁用:RU 升级后重启必崩放到具体场景里理解,使用时会更清楚。如果只是逐项记功能,Oracle的实际价值并不容易看出来。

放在具体场景中,而是升级过程触发了旧配置残留、权限错位或内核参数失效——尤其在 19c 及以后版本RU 升级会重写部分 GI 配置但不清理旧状态crsctl check crs 报 CRS-4537 或资源全 OFFLINE 是典型信号。Oracle RAC 打完 RU(Release Update)后集群异常大概率不是补丁本身坏了

先确认 ohasd 是否存活,别碰 crsctl start crs

更直接地说,必须立刻验证:ps -ef | grep ohasd —— 若无输出,说明 ohasd 进程根本没启动,此时执行 crsctl start crs 毫无意义。crsctl check crs 报 CRS-4537 时,本质是本地高可用服务没起来,所有 CRS 命令都失效。

  1. 检查 /etc/oracle/olr.loc 是否存在且路径有效:cat /etc/oracle/olr.loc,内容应类似 olrconfig_loc=/u01/app/19c/grid/cdata/olr.ocr;若路径指向不存在目录,或权限为 600(正确应为 644),ohasd 会静默失败
  2. 手动拉起:sudo /u01/app/19c/grid/bin/crsctl start ohasd,之后必须立即运行 crsctl check crs,看到 CRS-4638: Oracle High Availability Services is online 才算过关
  3. 若仍失败,查 $GRID_HOME/log/<hostname>/ohasd/ohasd.log,重点搜 OLRpermission deniedfailed to open

profile4downgrade.xml 权限错误:11g 升级 19c 后最隐蔽的 RU 坑

放在具体场景中,若权限不对,整个集群栈卡在初始化阶段,现象是 crsctl stop crs -f 后无法 clean shutdown,加节点报 PRCR-1079。RU 升级不会自动修复这个文件权限,但 GI 启动时会读它;

  1. 检查:ls -l $GRID_HOME/crs/install/profile4downgrade.xml,若显示 -rw-------(仅 root 可读),就是问题根源
  2. 正确权限应为 -rw-r--r-- 或至少 -rwxr-xr-x,属主为 grid:oinstall
  3. 修复命令:chmod 644 $GRID_HOME/crs/install/profile4downgrade.xml && chown grid:oinstall $GRID_HOME/crs/install/profile4downgrade.xml

transparent_hugepage 未禁用:RU 升级后重启必崩

换到实际使用里,但 19c+ 要求 transparent_hugepage=never 必须永久生效否则节点重启后 ora.cssd 卡住、ora.asm 启动失败、ORA-27102 频发。RU 升级不改内核参数

  1. 临时禁用无效:echo never > /sys/kernel/mm/transparent_hugepage/enabled 重启即失效
  2. 永久禁用:编辑 /etc/default/grub,在 GRUB_CMDLINE_LINUX 行末追加 transparent_hugepage=never,再执行 grub2-mkconfig -o /boot/grub2/grub.cfg 并重启
  3. 验证:cat /sys/kernel/mm/transparent_hugepage/enabled 输出应为 [never],且 grep AnonHugePages /proc/meminfo 返回 AnonHugePages: 0 kB

OCR/voting disk 不可达:RU 升级后 ASM 磁盘组常掉线

更直接地说,而是 OCR 所在磁盘组没挂载或 voting disk 路径权限不一致。crsctl stat res -t 显示资源状态为 INTERMEDIATE 或 UNKNOWN往往不是资源坏了

  1. 先看 ASM 状态:asmcmd lsdg,若 OCRVOTE 磁盘组状态为 DISMOUNTED,用 sqlplus / as sysasm 执行 ALTER DISKGROUP OCRVOTE MOUNT
  2. 查 voting disk 路径:crsctl query css votedisk,输出路径必须在所有节点上可被 root 读取(如 +OCRVOTE/dev/mapper/mpathb),且 ls -l 显示属主为 grid:oinstall、权限为 660(裸设备)或 644(NFS 文件)
  3. 私网连通性易被忽略:olsnodes -n 应列出全部节点编号;若缺失,查 $GRID_HOME/log/<hostname>/cssd/ocssd.logIPC Send timeout,大概率是防火墙拦了 UDP 12345

需要先分清的是,每一步都得验证,不能跳步。RU 升级后的异常,极少是补丁逻辑缺陷,绝大多数是环境状态没对齐——ohasd 没起来、profile4downgrade.xml 权限错、transparent_hugepage 漏禁、OCR 磁盘组没 mount,这四点覆盖了 90% 的真实故障。

热门栏目