orblog性能调优复盘
一、问题背景 本次优化围绕文章详情页 展开,重点压测页面是 。 最初现象是: - 直接压应用 端口 - 并发持续 - CPU 和内存都没有打满 - 但 延迟已经到了 这说明问题不是简单的“机器资源不够”,而更像是请求链路里有某种高成本处理,或者单实例吞吐已经先达到上限。 二、整体优化顺序 这次优化不是一步完成的,而是分成了三个非常清晰的阶段:...
·39 阅读
一、问题背景 本次优化围绕文章详情页 展开,重点压测页面是 。 最初现象是: - 直接压应用 端口 - 并发持续 - CPU 和内存都没有打满 - 但 延迟已经到了 这说明问题不是简单的“机器资源不够”,而更像是请求链路里有某种高成本处理,或者单实例吞吐已经先达到上限。 二、整体优化顺序 这次优化不是一步完成的,而是分成了三个非常清晰的阶段:...
一. 总览 二. 整体流程 - Tokenizer:切分token,参考模型中的和(词表和配置 - Embedding:根据tokenid,hash查表的方式获取对应的行。 - Transformer:QKV的attention计算+FNN。(后面细讲) - LM Head(Linear):可以和Embedding共享参数,把Hiddenstates变为词表中每个...
WebUI访问+Tools(高权限模式) - 替换为你自己的ip,替换为你的gatewaytoken。(注:需保证gatewaytoken安全。) - :支持在非https或者localhost环境下,用token认证。 - :跳过设备认证。 - :开启agent的全部tools权限。 备用模型设置 - :设置备用模型,当主模型不可用时,调用备用模型...
已加载全部文章