订阅

AI 硬件与部署 今日: 0|主题: 223|排名: 26 

  • 隐藏置顶帖 置顶 一起港湾 (17GW.com) 论坛发帖须知
    欢迎来到 一起港湾 (17GW) 社区!这里是 AI 技术爱好者、数码极客和生活分享者的精神家园。为了维护港湾的纯净秩序与技术氛围,请在开启您的分享之旅前,仔细阅读并遵守以下发帖规范。 一、 核心发帖准则 [*]主题契合,精准归类:请确保内容与所属版块(如 AI 技术、数码维修、资源分享等)相关。标题应简明扼要,避免“ ...
    1956 teanzhong 发表于 2026-3-29 站务公告与反馈
  • 自托管或开发自己的软件,并不需要太多条件。 New
    06 twinsbbs 发表于 前天 20:44 AI 硬件与部署
  • 苹果统一内存卖得有多贵,大家心里都有数。 New
    苹果统一内存卖得有多贵,大家心里都有数。 今天在 Reddit 刷到一个神级项目直接看傻了: 有人用一条 10 Gb/s 的 USB-C 线,把手里的 iPhone 变成了 24GB MacBook 的“副显卡”,用来跑本地 Qwen 27B 大模型,长文本速度暴涨 40%+! ...
    120 钱财随缘 发表于 3 天前 AI 硬件与部署
  • 自己搭个本地 AI 服务器,以前有多折腾你心里有数:Ollama、Open WebUI、n8n、ComfyUI 一个个装、一个个连,装到怀疑人生。 New
    自己搭个本地 AI 服务器,以前有多折腾你心里有数:Ollama、Open WebUI、n8n、ComfyUI 一个个装、一个个连,装到怀疑人生。 如今有个玩意儿叫 ODS,一行命令全给你装妥、接好,还自动按你的硬件挑模型,装完打开 localhost:3000 直接开唠。 我觉得最爽的是这几点: 1️⃣ 本地跑模型,prompt 和数据全在自己机器上,不上 ...
    037 凉凉凉了 发表于 4 天前 AI 硬件与部署
  • 以防有人不知道 > 12GB 显存的游戏电脑,已经能跑 125B 参数的大模型,最快每秒写 94 个 token 🫢 New
    以防有人不知道 > 12GB 显存的游戏电脑,已经能跑 125B 参数的大模型,最快每秒写 94 个 token 🫢 这个模型叫 Qwen3.8-Flash-Next,由一堆「专家」组成,每个 token 只用 6B 参数。开源推理引擎 Strata 把常用专家放显卡,全部专家放内存,显卡没有的让 CPU 同时算。 所以真正卡人的是内存。作者推荐 32GB 跑 Coder 版,4 ...
    029 密斯特真行 发表于 4 天前 AI 硬件与部署
  • 我的随身电脑是一台$50买来的旧Chromebook,2G内存,16G硬盘。 New
    我的随身电脑是一台$50买来的旧Chromebook,2G内存,16G硬盘。它自己当然干不了什么活儿,但是装上Linux系统之后,在tailscale和我不限流量的手机套餐加持下,我可以随时随地远程桌面到家里的强劲机器,以及ssh到我的vps们上,想干啥就干啥。它只是个终端,而且它非常省电,不需要带charger也能工作一整天。 如果哪一天换 ...
    051 小米的爸爸 发表于 5 天前 AI 硬件与部署
  • 这东西一开始只有不到900块,前段时间1200买了6张,现在这东西快涨到1400+了,因为倒腾双卡2080ti的那群人发了几个视频评价/推荐T10 16G。 New
    在边缘昏昏欲睡...... 这东西一开始只有不到900块,前段时间1200买了6张,现在这东西快涨到1400+了,因为倒腾双卡2080ti的那群人发了几个视频评价/推荐T10 16G。 如果你还在想改32G和激活NVLink的事情,我只能说没证据不行,也没证据说一定行,还是需要实验。 它用的TU102核心,2080ti FE改的板子。 ...
    063 一念法界 发表于 6 天前 AI 硬件与部署
  • 2B 参数的小模型,现在也开始能干活了?
    2B 参数的小模型,现在也开始能干活了? OpenBMB 的 MiniCPM5-2B,主打本地小硬件运行。有人把它接进 CI 修复 Agent,丢了一个“结算重试导致运费重复计算”的 Bug 给它。 模型自己复现问题、翻代码、定位原因,最后直接打补丁,18 个测试全部通过,而且全程本地运行。 几个亮点: ① 编程和工具调用能力不错 ② 2B 参 ...
    060 我爱榛子 发表于 2026-9-28 AI 硬件与部署
  • 2.78万亿参数,8GB内存,单颗CPU,这组合够离谱。
    2.78万亿参数,8GB内存,单颗CPU,这组合够离谱。 kimi-k3-in-c 这个开源项目,愣是用 176KB 的可移植 C99 代码把超大 MoE 带了起来,CUDA、PyTorch、BLAS 一概不用,GPU 也免了。 1️⃣ 896 个专家里,每个 Token 仅激活 16 个 2️⃣ 权重存 NVMe,剩下的按需流式喂进来 3️⃣ 8GB 内存下,吐一个 Token 差不多 26~32 ...
    057 茵梦湖 发表于 2026-9-28 AI 硬件与部署
  • Gemini 制作的 M5Stack CardputerZero X SONY VAIO type P “M5 VAIO” 骨架版
    073 糖球球 发表于 2026-9-27 AI 硬件与部署
  • 以前我不太了解在 Linux 终端里能做这么多事情。 谢谢大家的指点(感谢那些热心人)。
    059 Rcpchina 发表于 2026-9-26 AI 硬件与部署
  • 以紧凑机身提供强劲工作站级性能,助您运行本地 AI、大语言模型(LLM)及创意类工作负载。
    以紧凑机身提供强劲工作站级性能,助您运行本地 AI、大语言模型(LLM)及创意类工作负载。MS-S1 MAX 搭载 AMD Ryzen™ AI Max+ 395 处理器,具备高达 126 TOPS 的 AI 算力,并支持最高 128GB LPDDR5x 统一内存。使用优惠码 X45 即可额外立减 45 澳元。 ...
    082 永不死机 发表于 2026-9-25 AI 硬件与部署
  • 🔥低成本本地部署方案,12GB RTX3060 跑通 MiMo-V2.6-Distill-Qwen-9B,262K 超长上下文本地推理。
    🔥低成本本地部署方案,12GB RTX3060 跑通 MiMo-V2.6-Distill-Qwen-9B,262K 超长上下文本地推理。 采用 Q5_K_M 量化,搭配 Q8 KV 缓存、Flash Attention。 性能:解码约 47 tok/s,预填充约 1600 tok/s。 模型基于 Qwen3.5-9B 蒸馏,吸收大模型教师的推理能力,SWE-Pro 得分由 32.0 提升至 44.6。 单卡就能承载长上下文编 ...
    092 halczy 发表于 2026-9-25 AI 硬件与部署
  • 17美元、25分钟,微调出一个自己的 Jev 决策模型
    17美元、25分钟,微调出一个自己的 Jev 决策模型 来自 @togethercompute 团队 @nutlope 的实操教程,基于 Qwen3.5 4B,花 17 美元、约 25 分钟,微调出一个自己的“Jev 式”决策模型并部署成 API。同时他们把自己训练好的成品模型 together/Tev1-4B-experimental 开放了出来,整条数据配方和代码脚本全部开源在 GitHu ...
    0100 情牵百子归柜 发表于 2026-9-24 AI 硬件与部署
  • 以前折腾 TTS,要么上 GPU,要么接付费 API。
    以前折腾 TTS,要么上 GPU,要么接付费 API。 Kyutai 最近开源了 Pocket TTS,只有约 1 亿参数,主打直接在 CPU 上本地运行。 在 MacBook CPU 上,官方测试最高接近 6 倍实时速度,首个音频块大约 200ms 就能生成,而且只需要 2 个 CPU 核心。 它还支持语音克隆和 6 种语言,适合拿来做本地配音、语音助手之类的项目。 ...
    086 车险小周 发表于 2026-9-24 AI 硬件与部署
  • GPT 6 Luna 这价格真的神了
    5.6 Luna: 输入:0.25 美元/M 缓存输入:0.02 美元/M 输出:1.2 美元/M 6 Luna: 输入:0.125 美元/M 缓存输入:0.01 美元/M 输出:0.5 美元/M 输入降幅 50%,输出降幅 58%。 AAI Index 单任务价格和 Token 效率看上去也是遥遥领先同类模型。 要是奥特曼能让 TPS 再来个 50% 或者翻倍提升,感觉薅的 Gemini Flash 都 ...
    095 淑女红红 发表于 2026-9-23 AI 硬件与部署
  • 不想把 AI 和数据交给云厂商,也不想折腾复杂部署?
    不想把 AI 和数据交给云厂商,也不想折腾复杂部署? Olares 提供了一种本地 AI 云方案:把计算、存储和应用管理放回自己的硬件上。 它支持: 一键部署本地 AI 模型 GPU 资源自动调度 搭建私有知识库 应用沙箱隔离 统一管理存储、数据库和备份 多设备访问与统一登录 底层把 Kubernetes 等复杂基础设施封装起来,让自托管 ...
    0156 像昵 发表于 2026-9-14 AI 硬件与部署
  • 显存就这么多,怎么把字吐得更快?——从 MoE、KV Cache 到 DFlash 的本地部署全景拆解
    “一张 16GB 显卡,也能跑 27B 大模型。” 看到这句话,先别急着下载权重。 你还需要知道:用了什么量化?上下文开了多长?模型是否全部放在显存里?所谓“快”,指开始回答快,还是回答时每秒生成的 token 多? 这些条件不同,“能跑”的含义可能相差很大。模型成功加载,只是第一步;能读完你的材料、给出可靠答案,并 ...
    0139 丫丫快递 发表于 2026-9-14 AI 硬件与部署
  • 在着手编写这本手册之前,我自以为理解了 GPU 利用率的概念。
    在着手编写这本手册之前,我自以为理解了 GPU 利用率的概念。 我曾一度将三个截然不同的概念混为一谈:内核(kernel)启动的任务、实际驻留在 GPU 上的任务,以及当前准备好发射(issue)的任务。它们并非同一回事。 以一个包含 240 个线程块(block)、每个块 256 个线程的内核为例。这意味着共有 61,440 个逻辑线程,即 ...
    0154 树叶人 发表于 2026-9-13 AI 硬件与部署
  • 有本事就来拿 未经注册的算力全天候运行着非法的中国产“叮当响”机器
    有本事就来拿 未经注册的算力全天候运行着非法的中国产“叮当响”机器
    0139 善宣 发表于 2026-9-13 AI 硬件与部署
  • 有本事就来拿
    0144 用户大弟 发表于 2026-9-13 AI 硬件与部署
  • 下一页 »

    快速发帖

    还可输入 120 个字符
    您需要登录后才可以发帖 登录 | 立即注册

    本版积分规则

    关注公众号

    相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

    Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

    在本版发帖
    关注公众号
    返回顶部