1.
确认ERP版本、模块、并发用户峰值、第三方接口、报表与历史数据量。列出上线时间窗口、负责人名单和联系人(开发、运维、网络、数据库、供应商)。
准备清单:业务需求文档、数据字典、现网流量样本、备份策略、测试用例与性能验收指标(如响应95分位、并发事务/秒、每日备份窗口)。
2.
步骤一:估算并发。按并发用户 = 峰值在线用户 × 活跃率(例如1000人×20% = 200并发)。
步骤二:计算CPU/RAM。一般Web/App每100并发建议2-4 vCPU与4-8GB内存,数据库按数据量与连接数,基础估算:内存 >= 数据库缓冲池(InnoDB buffer_pool) + 操作系统内存(2-4GB)。
步骤三:磁盘与IOPS。按每月写入量计算,使用SSD并配置RAID10。保证磁盘延迟<5ms,估算IOPS需参考测试(见性能测试部分)。
3.
优先选择具有多运营商直连(BGP)、国际出口带宽充足、距离粤港较近的机房以降低延迟。确认是否提供跨境优化加速或专线接入。
核查资质与服务:年限、客户案例、物理安全(门禁、视频)、电力冗余(N+1或2N)、冷却与消防、现场技术支持时效(现场响应 SLA)。
4.
CPU:选择企业级处理器,确保主频与核心数满足并发计算。内存:留出50%以上给数据库缓冲区。磁盘:企业级NVMe或SATA SSD,RAID10,配置热备盘。
网络:双网卡绑定(bonding/LACP),至少1Gbps冗余,关键节点建议10Gbps。电源与机架:双电源、PDU监控、机柜冗余布局。
5.
带宽:按峰值并发和每次请求均值估算带宽,预留50%富余;签订带宽SLA。启用BGP多线、静态路由优化、TCP优化设备或WAF。
安全:配置DDoS防护、入侵检测、边界防火墙与WAF规则;对于跨境访问,考虑专线或SD-WAN以稳定延迟。
6.
推荐三层架构:负载均衡(LB)→ 应用层(App/Worker)→ 数据库(主从/主主或集群)。LB可使用HAProxy/Nginx+Keepalived实现虚拟IP高可用。
数据库高可用:主从同步(半同步/异步)或使用Galera、Percona XtraDB Cluster,根据RPO/RTO选择异地灾备。定期演练主从切换流程。
7.
在Linux生产机上建议设置(以sysctl为例):编辑/etc/sysctl.conf并追加:
net.core.somaxconn = 1024 net.ipv4.tcp_tw_reuse = 1 net.ipv4.tcp_fin_timeout = 15 vm.swappiness = 10
生效命令:sysctl -p。磁盘调优:使用noop或deadline调度器对SSD:echo noop > /sys/block/sdX/queue/scheduler。注意先在测试环境验证。
8.
配置InnoDB:innodb_buffer_pool_size≈物理内存的60-70%,innodb_log_file_size按事务量调整(64M-1G),打开慢查询日志并优化索引。
备份:每日冷备+实时binlog备份以实现PITR。使用mysqldump或xtrabackup做热备份,示例xtrabackup步骤:准备(xtrabackup --backup --target-dir=/data/backup)→ 完成后apply-log → 上传至异地存储。
9.
步骤一:构建制品。使用CI工具(Jenkins/GitLab CI)自动化构建并生成版本号、构建镜像或tar包。
步骤二:发布流程。先在灰度环境部署并运行自动化回归、性能测试。确认无误后通过蓝绿或滚动更新在生产节点逐台替换,降低风险。
步骤三:回滚。保留最近N个可回滚制品,写好回滚脚本并在发布前验证回滚时间窗。
10.
准备测试脚本:根据真实流量录制JMeter或k6脚本,模拟峰值并发与事务分布。先做稳态低并发功能测试,再升压到目标并发。
监测项:CPU、内存、磁盘I/O、网络延迟、数据库慢查询、应用错误率。设定验收标准,例如95%请求响应<2s、错误率<0.5%。
11.
推荐栈:Prometheus采集、Grafana展示、Alertmanager告警;日志采用ELK/EFK集中管理。关键告警示例:磁盘使用>80%、连接数接近上限、慢查询数量异常增加。
日常:配置自动化脚本进行健康检查(端口、进程、接口响应),并编写应急SOP(主从切换、恢复备份、扩容流程)。
12.
答:香港机房对内地和国际访问都具有较低的延迟和更稳定的国际出口,若客户有跨境业务或多地办公室,BGP多线与丰富的国际带宽能降低访问抖动;同时香港机房的电力与网络冗余、运营商选择与法规优势也利于业务连续性与合规。
13.
答:定位步骤:1)重现或记录问题时间段;2)采集全栈监控(应用、DB、网络、OS);3)对比指标找瓶颈点(CPU、IO、锁等待、慢查询、带宽饱和)。解决顺序一般为:优化SQL与索引、增加DB缓冲、调整应用线程池、扩展服务器或增加读写分离、在网络层使用CDN或专线。
14.
答:上线前核对清单:容量与冗余(CPU/内存/磁盘/带宽达标)、备份与恢复(恢复时长RTO、数据丢失RPO确认)、监控与告警配置、演练主从切换、性能测试达标、应急联系人与运维SOP到位、供应商售后与现场响应SLA确认。
