兄弟们,炸裂消息。苏姿丰拎了个饭盒大小的主机上台,现场跑起2350亿参数大模型。
兄弟们,炸裂消息。苏姿丰拎了个饭盒大小的主机上台,现场跑起2350亿参数大模型。
不靠云端不租GPU,全靠AMD Ryzen AI Max+ 395,全球首款CPU和GPU共享统一内存的x86处理器,128GB统一内存。
对比一下:RTX 5090才32GB显存,RTX 4090就24GB,这台小主机128GB,是旗舰独显的三倍多。实测DeepSeek R1推理,性能干到RTX 5080 ...
🔥本地部署机器怎么选?!
🔥本地部署机器怎么选?!
看下面这张图就很直观了
个人推荐:
1. Mac Studio M5 Ultra 96G
2. 2x RTX 4090 24G
3. RTX 4090 魔改 48G - 胆大的来
4. DGX Spark
事实证明,苹果芯片架构是LLM(层级存储器)的理想之选。它将高速内存、高带宽和统一架构完美结合,堪称神奇。
事实证明,苹果芯片架构是LLM(层级存储器)的理想之选。它将高速内存、高带宽和统一架构完美结合,堪称神奇。Mac Studio M5 Ultra(512GB,1.2TB/s)搭载了完整的GLM-5.3-Flash(320字节),采用FP8格式,并可在桌面上实现约60t/s的离线读写速度。PC的替代方案?10块RTX 5090显卡,售价超过2万美元,外加你自己的迷你电源 ...
Easy同学正在独立开发# FreeToken 加速效果:
#Easy同学正在独立开发# FreeToken 加速效果:
- 配备 8GB 显存 RTX 4060 的普通笔记本电脑能以 39 tok/s 的速度运行 35B 模型
- 而搭载 RTX 5090 的游戏台式机则能以交互方式运行庞大的 284B DeepSeek 模型。
为什么它能做到?我让 Gemini 解读了一下它的论文
...
🚨NVIDIA 正在免费赠送 5 款最先进的中国 AI 模型
🚨NVIDIA 正在免费赠送 5 款最先进的中国 AI 模型
无需显卡。
无需订阅。
无需为每个模型付费。
只需一个 API 密钥即可访问全部 5 款模型。
以下是您可以免费使用的模型:
DeepSeek V4 Flash → 超高速推理
MiniMax M3 → 编码和开发
Qwen3.5-397B → 高级推理
Kimi K2.6 → 智能体和复杂工作流程
GLM 5.1 → 适 ...
“你需要一块5090显卡来实现本地人工智能!!!” 哈哈,随便你吧,书呆子。
如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1)
如果你像我一样贫穷,只有 24G 的显存,可以在 unsloth studio 里面这么设置参数(图 1),这样可以把默认 70K 的 Context 长度拉到 213K,并且在长程的任务中仍然能够保证到 20+ tok/s,短任务的话 50 tok/s 没问题。
这个配置的思路是腾出更多的显存,所以会默认把 Vision 的能力给关掉,把 KVCache 降为 q4_0(注意别选 ...
转:从H200到GB300,真实Agent工作负载的吞吐量提升了最高30倍,成本大致翻倍。
转:从H200到GB300,真实Agent工作负载的吞吐量提升了最高30倍,成本大致翻倍。
从GB300到Vera Rubin,吞吐量再次飙升最高30倍,整机架价格大致再翻倍。
按照老黄的摩尔定律,合着这两年英伟达最大的技术突破不是GPU本身,而是让价格贵了4倍,却换来了整整900倍的速度飞跃!
大模型时代,英伟达靠GPU拿下训练和推理。
A ...
如果堆叠 4 块 M5 Ultra,我预计运行 Kimi K3 / GLM 5.3 的速度将比 API 快得多(>100 tok/秒)。
512GB 的 M5 Ultra 将于 10 月上市,拥有高达 1.2TB/s 的内存带宽。
内存带宽比 M3 Ultra 高出 50%,比 DGX Spark 和 M4 Pro 高出 4.4 倍。
如果堆叠 4 块 M5 Ultra,我预计运行 Kimi K3 / GLM 5.3 的速度将比 API 快得多(>100 tok/秒)。
Ventuno Q 单板计算机 (SBC) 即将开启预售,售价 299 美元。
@Arduino
Ventuno Q 单板计算机 (SBC) 即将开启预售,售价 299 美元。
https://cnx-software.com/2026/08/25/299-arduino-ventuno-q-sbc-combines-qualcomm-dragonwing-iq8-soc-and-stm32h5-mcu/
这款全新的单板计算机将高通 Dragonwing IQ8 (IQ-8275) 边缘 AI SoC 与意法半导体 (STMicroelectronics) STM32H5F5 Arm Cor ...
这将是终极版 Mac Pro:采用今天早些时候泄露的苹果私有云计算服务器架构,并将其缩小到桌面工作站的体积。
这将是终极版 Mac Pro:采用今天早些时候泄露的苹果私有云计算服务器架构,并将其缩小到桌面工作站的体积。
- 最多可配备 4 个计算单元,每个单元都位于独立的扩展卡上,搭载 M5 Pro 或 M5 Max 处理器
- 每个计算单元配备 32GB、64GB 或 128GB 统一内存
- 每个计算单元配备一块 SSD,主板上还可选配 2 块 SSD
- 计算单 ...
开源硬件模块化迷你电脑,可选配超过 10 种 Arm CPU 和 FPGA 模块。
开源硬件模块化迷你电脑,可选配超过 10 种 Arm CPU 和 FPGA 模块。
https://cnx-software.com/2026/08/24/mnt-station-fanless-modular-open-hardware-computer-supports-a-choice-of-10-arm-cpu-or-fpga-modules/
MNT Research 的 MNT Station 无风扇电脑采用 200 引脚模块,支持 Rockchip、NXP、Amlogic、Broadcom(可 ...
工厂又顺利完成了一天的工作。16 台卡片/机器正在运行推理程序或托管代理。
他的“AI服务器”其实是四台Mac Mini,堆叠在烤面包机旁边。
他的“AI服务器”其实是四台Mac Mini,堆叠在烤面包机旁边。
它们通过开源软件连接成一台机器,运行着2350亿个模型,这是任何单台电脑都无法加载的。
受监管的客户每月支付他3500美元使用这台服务器。
他有六台这样的服务器。
这意味着他厨房里这堆银色盒子每月能带来2.1万美元的收入。
这套服务器运行的是开源软件Exo ...
如果你的 ESP32-S3 拥有一个 1.6 TOPS 的 AI 助手会怎样?🤯
如果你的 ESP32-S3 拥有一个 1.6 TOPS 的 AI 助手会怎样?🤯
LILYGO T-Display K230 是一款功能强大的小型 AI 开发板。
它将 K230 双核 RISC-V SoC 与 ESP32-S3-R8 协处理器完美结合。
- K230:1.6 GHz + 800 MHz RISC-V 内核
- NPU:最高可达约 1.6 TOPS
- 内存:8 GB LPDDR4
- ESP32-S3:16 MB Flash + Wi-Fi + 蓝 ...
我现在基本上都是随身带着电脑
我现在基本上都是随身带着电脑
刚给车充电的时候,部署了下午开发的工具站
买域名,解析到 Cloudflare,通过 GitHub 部署到 Vercel ,一气呵成,太爽了
整理我的人工智能实验室
你是谁?为什么你没有自己的引擎缸体来进行快速推理?
我不明白为什么大家还没开始使用人工智能代理。
我不明白为什么大家还没开始使用人工智能代理。
大多数人只用 ChatGPT 就止步了。
以下是 12 款被低估的人工智能工具,它们的功能比 ChatGPT 强大 10 倍:⬇️
Herdr 全面调研与使用教程
Herdr 全面调研与使用教程
http://t.cn/AXNV9VEs
文档作者向阳乔木。Herdr 是一款专为 AI 编码时代设计的轻量级终端多路复用与管理工具(Agent Multiplexer)。它类似于专门针对 AI 代理(如 Claude Code、Codex 等)优化的 tmux,能在一个终端界面中通过工作区、标签页和分屏来并行运行和集中调度多个 AI 编程助手。
...