1.
1.1 确定目标RTO/RPO:比如页面可用性99.95%、数据恢复点不超过1小时。
1.2 评估流量与性能:并发连接、带宽峰值、是否需要GPU或大IO。
1.3 预算范围:月成本(如$100–$2000)决定可选类型(云VPS、托管独服或机柜)。
2.
2.1 云VPS/云主机(如阿里/腾讯/阿里香港、AWS ap-east-1):弹性、易扩容,适合预算中低且希望快速上线的企业。
2.2 托管独服/机柜:性能稳定、网络可控,适合长期高IO/合规需求但前期投入较高。
2.3 混合方案:前端使用云负载+CDN,后端数据库放在托管机柜或专线云数据库实现成本与性能平衡。
3.
3.1 选有香港多可用区或有本地骨干网络的供应商,查看上行带宽、对等点(IX)和第三方延迟测试。
3.2 对比SLA、DDoS缓解、带宽峰值计费方式(95/5计费或峰值计费)。
3.3 若客户群体主要在中国大陆,可优先选择与香港电信有良好直连的提供商或使用租用专线。
4.
4.1 小预算(<$200/月):香港云VPS 2vCPU、4GB内存、50GB盘,使用云负载和Cloudflare CDN。
4.2 中预算($200–$800/月):2台应用节点+1个主从数据库(云托管或RDS),云LB、自动快照备份。
4.3 高可用/性能(>$800/月):多AZ部署、独服主库+异地备份、机柜或专线接入。
5.
5.1 购买与网络规划:在香港区域分别创建2个应用实例(A、B),一个数据库实例(主库),一个只读从库或备份主机;配置私有网络(VPC)并开启安全组。
5.2 系统与环境准备(以Ubuntu为例):SSH登录后执行: apt update && apt upgrade -y apt install nginx mysql-client git -y
5.3 应用部署:将代码用git拉到/var/www,配置systemd服务,反向代理到本地端口;示例:
cd /var/www && git clone
6.
6.1 使用云LB(或HAProxy/Nginx做反向负载)配置轮询/最少连接策略,设置健康检查接口如/health返回200。
6.2 健康检查设置:间隔10s,超时5s,连续失败3次下线;上线条件连续3次成功。
6.3 HTTPS与证书:推荐用Let’s Encrypt自动签发,certbot自动续期并reload nginx。
7.
7.1 若使用MySQL:配置主从复制或使用托管RDS的自动主备;每5分钟做binlog备份,每日做全量快照。
7.2 备份存储:快照存云对象存储(COS/S3)并设置生命周期策略;关键数据异地复制到新加坡/北京以防区域灾难。
7.3 恢复演练:每季度做一次从冷备恢复演练,验证RTO是否满足目标。
8.
8.1 静态文件使用对象存储或NFS,避免本地磁盘写入导致节点不同步。
8.2 会话共享:使用Redis集群保存会话或JWT无状态设计,防止拉到不同节点造成用户丢失会话。
8.3 文件上传同步:使用rsync或开源工具(如lsyncd)将文件实时同步到另一个节点备用机。
9.
9.1 安全:开启安全组仅放通需要端口(22限IP、80/443),安装Fail2Ban,启用WAF或Cloudflare防护。
9.2 监控与告警:部署Prometheus+Grafana或使用供应商监控,设置CPU、内存、响应时间告警;邮件/钉钉/Slack联动。
9.3 成本控制:使用按需+保留策略,定期清理快照与闲置资源,设置预算告警。
10.
10.1 模拟节点故障:手动下线一台应用节点,观察LB是否将流量切到健康节点,检查无中断。
10.2 模拟数据库宕机:故障切换到从库并Promote为主库,更新应用DB连接配置并验证写入。
10.3 记录演练日志并优化脚本,使恢复步骤可以在10–30分钟内完成。
11.
11.1 每日:监控告警确认、磁盘与队列检查。

11.2 每周:快照备份验证、证书有效期检查。
11.3 每月:费用报告、容量规划、演练并更新文档。
12.
答:若以上线速度与弹性为优先,云主机更适合;若追求长期高性能与带宽稳定、需要合规或自有硬件控制,独立服务器/机柜更合适。预算小且人手少建议云主机起步,后续流量稳定再考虑迁移或混合部署。
13.
答:使用两台应用节点+云负载均衡、启用CDN缓存、数据库做主从或托管RDS、对象存储做静态及备份;通过自动快照、健康检查与自动化脚本缩短恢复时间,这些措施成本较低但能显著提升可用性。
14.
答:常被忽视的有会话/上传文件不共享导致切换失败、备份未测试无法恢复、健康检查接口实现不完整、错误的安全组或防火墙规则导致切换失败。上线前务必做故障演练并完善运维文档。