ChainThink 消息,8 月 8 日,据开发者开源项目 kimi-k3-in-c 信息,有开发者尝试让 2.78 万亿参数的 Kimi K3 模型在仅 8GB 内存设备上运行。
该项目体积约 176KB,采用纯 C99 编写,不依赖 GPU、CUDA、PyTorch 或 BLAS,可通过 CPU 完成模型推理。
其实现利用 Kimi K3 的 MoE 架构,每层 896 个专家中仅激活 16 个,因此无需将约 1.56TB 完整模型权重加载进内存,而是将大部分专家权重存储在 NVMe 硬盘中,并按推理需求实时读取。
目前该方案仍有明显性能限制:在 8GB 内存模式下,生成一个 token 约需 32.7 秒,同时需要接近 1.7TB 高速存储空间。
开发者称,该方案更接近大模型推理基础设施优化方向的实验探索,尚不具备生产使用价值。
免责声明:含第三方意见,不构成财务建议
OpenAI总裁警告:AI黑客能力正在扩散,企业仅剩数月补齐防线
53 分钟前
阿里云启用韩国第三座数据中心
5 小时前
Anthropic公开模型只是冰山一角:更强的Mythos 2捏着不发,下一代Mythos 3也在推进
5 小时前
Anthropic ARR引发估值争议:650亿美元年化收入背后,市场开始追问AI增长斜率
5 小时前
Kimi Work被曝泄漏隐私:提个Bug,最近5个Agent会话也被打包上传
6 小时前
Cursor开始抢GitHub饭碗:Origin正式开放Beta
9 小时前
AI自动化初创公司Relay关闭,创始人加入谷歌Chrome团队
10 小时前






