
让 macOS 虚拟机里的 llama.cpp 提速 16 倍:Metal 能力 shim 实操指南
Apple 的 Virtualization.framework 会给 macOS 虚拟机里的虚拟 GPU 上报保守的 Metal 能力,导致 llama.cpp 只能走慢速 GPU 路径。用 Cua 开源的一个进程级 shim,可以把提示处理速度提升 7-11 倍、token 生成速度提升 8-16 倍。
后端、跨平台、AI编程

Apple 的 Virtualization.framework 会给 macOS 虚拟机里的虚拟 GPU 上报保守的 Metal 能力,导致 llama.cpp 只能走慢速 GPU 路径。用 Cua 开源的一个进程级 shim,可以把提示处理速度提升 7-11 倍、token 生成速度提升 8-16 倍。

手把手教你把 llama.cpp 起的本地模型接入 OpenClaw:安装、启动 OpenAI 兼容服务器、写配置、配混合 fallback,所有参数来自官方文档,抄完就能用。

知名独立开发者 phoboslab 用 C 重写自己的 JS 游戏引擎,做出了自 2002 年以来第二款实体发行的全新 N64 游戏。这篇教程覆盖硬件、工具链、模拟器、真机调试和发行全流程。

比利时开发者 Tim Deschryver 用一个月时间让 AI Agent 从零重写整个项目,本文拆解他的完整工作流:AGENTS.md 统一上下文、Agent Skills 按需加载、OpenSpec 规格驱动开发,以及如何用符号链接让不同工具共享同一套配置。

imec 团队用 64 个真实编程任务测试了 4 套自托管方案:DGX Spark 只够 1 个人用,单张 H200 能带 32 个并发会话,8 张 B200 才能跑近前沿模型但并发反而更少。买 GPU 到底划不划算?答案取决于你的利用率。

MCP 官方 2026-07-28 文档更新引入了一套全新的构建方式:把 mcp-server-dev 插件装进 Claude Code 等编码助手,让 AI 自己问清楚需求、选对部署路径、生成 MCP Server 代码。本文带你走完整个流程。

手把手教你用类型化工具、DAG 并行调度、分层记忆、验证层级、Planner/Worker/Critic 角色分离、多维预算和追踪器,把一个简单的 LLM 循环升级成生产级 Agentic Harness。

304B 参数模型、无需量化、168.6 tok/s 单流解码:一个开源仓库把 DeepSeek V4 Flash 在单张 MI300X 上的生产级部署配置全部开源,含镜像锁定、补丁和调优表

Qwen3.8-Max 已上线 API,本教程带你把它接入 Codex、Qoder、Qwen Code、OpenClaw 四个主流 AI 编程工具,所有配置参数均来自官方文档,复制即可用。

Go 1.27 即将发布,这可能是近几年语言特性最多的一次更新:方法终于可以声明自己的类型参数(泛型方法)、encoding/json/v2 正式转正、标准库新增 uuid 和后量子签名 ML-DSA 包、goroutine 泄漏分析器转正。基于 VictoriaMetrics 的交互式教程逐条解读。

pgtestdb 用 Postgres 模板数据库给每个测试一个完整迁移好的独立数据库,迁移只跑一次、每个测试约 20ms 拿到数据库、天然支持并行——本文讲透原理、用法和实测数据

把 vLLM 从演示级推到生产级:镜像版本锁定、GPU 内存调优、前缀缓存、KEDA 自动扩缩、监控告警,一套可以直接抄的完整配置