最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
Oracle RAC RU升级后集群异常怎么办-操作步骤和注意点
时间:2026-08-27 10:02:48 编辑:袖梨 来源:一聚教程网
放在具体场景中,把先确认 ohasd 是否存活,别碰 crsctl start crs、profile4downgrade.xml 权限错误:11g 升级 19c 后最隐蔽的 RU 坑、transparent_hugepage 未禁用:RU 升级后重启必崩放到具体场景里理解,使用时会更清楚。如果只是逐项记功能,Oracle的实际价值并不容易看出来。
放在具体场景中,而是升级过程触发了旧配置残留、权限错位或内核参数失效——尤其在 19c 及以后版本RU 升级会重写部分 GI 配置但不清理旧状态crsctl check crs 报 CRS-4537 或资源全 OFFLINE 是典型信号。Oracle RAC 打完 RU(Release Update)后集群异常大概率不是补丁本身坏了
先确认 ohasd 是否存活,别碰 crsctl start crs
更直接地说,必须立刻验证:ps -ef | grep ohasd —— 若无输出,说明 ohasd 进程根本没启动,此时执行 crsctl start crs 毫无意义。crsctl check crs 报 CRS-4537 时,本质是本地高可用服务没起来,所有 CRS 命令都失效。
- 检查
/etc/oracle/olr.loc是否存在且路径有效:cat /etc/oracle/olr.loc,内容应类似olrconfig_loc=/u01/app/19c/grid/cdata/olr.ocr;若路径指向不存在目录,或权限为600(正确应为644),ohasd会静默失败 - 手动拉起:
sudo /u01/app/19c/grid/bin/crsctl start ohasd,之后必须立即运行crsctl check crs,看到CRS-4638: Oracle High Availability Services is online才算过关 - 若仍失败,查
$GRID_HOME/log/<hostname>/ohasd/ohasd.log,重点搜OLR、permission denied、failed to open
profile4downgrade.xml 权限错误:11g 升级 19c 后最隐蔽的 RU 坑
放在具体场景中,若权限不对,整个集群栈卡在初始化阶段,现象是 crsctl stop crs -f 后无法 clean shutdown,加节点报 PRCR-1079。RU 升级不会自动修复这个文件权限,但 GI 启动时会读它;
- 检查:
ls -l $GRID_HOME/crs/install/profile4downgrade.xml,若显示-rw-------(仅 root 可读),就是问题根源 - 正确权限应为
-rw-r--r--或至少-rwxr-xr-x,属主为grid:oinstall - 修复命令:
chmod 644 $GRID_HOME/crs/install/profile4downgrade.xml && chown grid:oinstall $GRID_HOME/crs/install/profile4downgrade.xml
transparent_hugepage 未禁用:RU 升级后重启必崩
换到实际使用里,但 19c+ 要求 transparent_hugepage=never 必须永久生效否则节点重启后 ora.cssd 卡住、ora.asm 启动失败、ORA-27102 频发。RU 升级不改内核参数
- 临时禁用无效:
echo never > /sys/kernel/mm/transparent_hugepage/enabled重启即失效 - 永久禁用:编辑
/etc/default/grub,在GRUB_CMDLINE_LINUX行末追加transparent_hugepage=never,再执行grub2-mkconfig -o /boot/grub2/grub.cfg并重启 - 验证:
cat /sys/kernel/mm/transparent_hugepage/enabled输出应为[never],且grep AnonHugePages /proc/meminfo返回AnonHugePages: 0 kB
OCR/voting disk 不可达:RU 升级后 ASM 磁盘组常掉线
更直接地说,而是 OCR 所在磁盘组没挂载或 voting disk 路径权限不一致。crsctl stat res -t 显示资源状态为 INTERMEDIATE 或 UNKNOWN往往不是资源坏了
- 先看 ASM 状态:
asmcmd lsdg,若OCRVOTE磁盘组状态为DISMOUNTED,用sqlplus / as sysasm执行ALTER DISKGROUP OCRVOTE MOUNT - 查 voting disk 路径:
crsctl query css votedisk,输出路径必须在所有节点上可被root读取(如+OCRVOTE或/dev/mapper/mpathb),且ls -l显示属主为grid:oinstall、权限为660(裸设备)或644(NFS 文件) - 私网连通性易被忽略:
olsnodes -n应列出全部节点编号;若缺失,查$GRID_HOME/log/<hostname>/cssd/ocssd.log中IPC Send timeout,大概率是防火墙拦了 UDP 12345
需要先分清的是,每一步都得验证,不能跳步。RU 升级后的异常,极少是补丁逻辑缺陷,绝大多数是环境状态没对齐——ohasd 没起来、profile4downgrade.xml 权限错、transparent_hugepage 漏禁、OCR 磁盘组没 mount,这四点覆盖了 90% 的真实故障。