重新审视-「思维链」未必是真思维-一篇ICML 2026 论文的论证与启示
今天24级带佬崔总推荐了一篇 arXiv 编号2504.09762,投给ICML 2026 的这篇论文,粗略一看我以为又一篇很常见的那种「我反对一下」的文章。
细读之后才发觉并非 …
今天24级带佬崔总推荐了一篇 arXiv 编号2504.09762,投给ICML 2026 的这篇论文,粗略一看我以为又一篇很常见的那种「我反对一下」的文章。
细读之后才发觉并非 …
如果你最近才开始折腾本地LLM部署或者开发AI Agent,大概率会在Windows上碰壁。这不是说Windows不能用,而是整个AI生态的“原生环境”其实是Linux。
在Windows上跑大模型,你往往要经历WSL2的性能损耗、诡异的 …
工业界一切都要考虑成本,做智能体(Agent)系统,最大的痛点其实未必是模型不够聪明,而更可能是成本过高。
Manus、OpenClaw、Harness这些产品,背后挂的 …
当你给AI发了一张图,它给出了详细的分析和推理——但你有没有想过,它可能根本没在看图?
咱们今天聊个大模型落地时绕不开的两个东西:CPT和SFT。
你可能听说过,大模型很厉害,什么都能聊两句。但真要把它放到医院、法 …
几年前的时候,RX580有2304SP版本,曾经是我想要申请而不得的高性能的显卡,后来有了2048SP的版本,然后最近还有一些第三方改造的16G显存的2048SP版本。
那对比一下 …
最近自己和一些老师都有录制教学视频,但录音设备不太行,而且录音环境页不太理想,总有一些噪音。那没办法,就想着降 …
最近遇到一个实际问题:做 agent 开发时,消息长度一旦超过模型上下文限制,大多数方案都是简单粗暴地截断——后面的内容直 …
起因很简单。我在 Ollama 上跑着 huihui_ai/qwen3.5-abliterated:0.8B 和 huihui_ai/lfm2.5-abliterated:latest 这两个模型,觉得挺有意思,就想着能不能把它们转成 HuggingFace 的 safetensors 格式。没别 …
最近几天让孩子们进行各种模型运行的探索,这个过程正好简单来测试 8 种 KV Cache 量化方案,看看对于降低显存和内存占 …
想象一下: 你手机里存了1000张照片,现在想让AI帮你快速找到"和猫咪有关的那几张"。
AI不是一张张看,而是把每张照片变成一串数字(这串数字就是"向量"),然后通 …
本文原文地址:arxiv.org/html/2504.19874v1
作者:
Amir Zandieh (Google Research),
Majid Daliri (New York University),
Majid Hadian (Google DeepMind),
Vahab Mirrokni (Google Research)
向量量化是香农信源编码理论中的核心问 …
之前的测试发现 MoXing 和 Ollama 在 qwen3 系列模型上速度差不多,但在 omnicoder-9b 上差距很大。
稍微深入调查了一下,发现关键不仅仅在于上下 …
最近发现一个有趣的代码模型:OmniCoder-9B。这个模型基于 Qwen3.5,专门针对代码生成做了优化。
花了一些时间用 MoXing 和 Ollama 两个工具测试 …
做RAG系统或者语义搜索的时候,嵌入模型的选择往往决定了整个系统的上限。Ollama平台上现在有十多款嵌入模型可供选择,功能定位各异,性能差距也不小。这篇文章把平台上所有的嵌入模型 …
最近在用本地大模型的时候,发现同样的模型在不同工具上跑起来速度差很多。我花了一些时间研究了一下 MoXing 和 Ollama 的区 …
如果你正在用 Ollama 在本地跑大模型,可能会遇到这样的困惑:命令行操作虽然高效,但每次想看看有哪些模型、某个模型占用 …
先说在前面,这个"类Cursor体验"只能说体验上有些相似。
Void项目(https://github.com/voideditor/void)目前似乎已停止维护,而MoXing项目(https://github.com/cycleuser/MoXing)本质上就是llama.cpp的Python封装层,整体 …
在大语言模型(LLM)日益普及的今天,很多人希望能在本地运行自己的模型。然而,对于使用AMD显卡的用户来说,配置ROCm环境是个令人一些同学疼的问题。而NVIDIA的显卡,价格真是让我高攀 …
在大语言模型(Large Language Model, LLM)中,Token(令牌、词元、子词单元)是模型处理文本的最小单元。可是怎么翻译呢?今天群里一位老师就这样 …
你有没有过这样的经历:工作忙得焦头烂额,消息响个不停,回也不是不回也不是。或者有时候就是懒得打字,但又不想让朋 …
这就是一个实验性质的探索工具,旨在尝试通过 POSIX 兼容层,在操作系统与本地大语言模型(LLM)之间建立初步的互动连接。
LLaMA-Factory 是一个功能强大且易于使用的开源框架,支持对 100 多种大语言模型(LLMs)和视觉语言模型(VLMs)进行统一高效的微调。它集成 …
于劲郭 于劲郭
•一部分 …
很多朋友可能也在用Ollama来下载和管理模型,下载速度还不错,而且功能也简便,最新版本的Ollama更是提供了一个简洁的GUI,可以直接选择模型对话,还能地对模型下载位置 …
大模型的使用,如果仅局限于简单对话,其实是很难发挥出全部效用的,也很难构成完整的生产力。
组织和编排才是更高效 …
现在本地部署的大模型,有可能有一个问题,就是经常是“真空中的模型”,不具备当前环境的“感知”,很难用于回答与本机或当 …
上次的小模型批量测试对于需要速度的场景来说也就是可以看个乐,对于需要质量的情况来说,可能就完全不够看了。毕 …
谷歌好像是最近刚发了gemma3:0.27b,也就是gemma3:270m的版本,这个可是比qwen3:0.6b还要轻量级很多。 这个版本的在线测评倒是不少了,但正如之前咱们谈论过 …
前些天,在千问的一个官方群里,有朋友询问4060笔记本显卡是否能够运行gpt-oss:20b模型,群里的一些朋友表示这几乎是不可能的。 类似地,之前关于Void编辑器搭配本地模型的一篇文章中也有读者 …
之前的文章介绍了Void 编辑器, 又介绍了基于 Ollama 的 Qwen3-4B-2507 模型部署,这个模型特别轻量级,甚至可以在千元红米手机上流畅运行 …
昨天千问发布了最新的Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型,看到千问官方群里一位群友在手机上运行,感觉很厉害,得知mnn chat就可以部署,于是就动手试试看 …
昨天千问发布了最新的Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型,有如下两个亮点:
1.Qwen3-4B-Instruct-2507 的通用能力超越了商业闭源的小尺寸模型 GPT-4.1-nano,与中等规模的 …
OllamaModelManager[1] 是一个图形化界面工具,用于快速导出导入已经下载好的Ollama模型,新加了一个功能,可以更新和删除模型了。
去年就写过一 …
一直以来,我都痴迷于本地模型。
一方面是我所在地区的网速实在不理想,另一方面是我不太信任云服务。
最近好像有个消 …
之前随手发过使用ollama本地部署qwen3-30b-a3b-thinking_q8 以及 qwen3-30b-a3b-instruct_q8 的简单命令。
有的朋友问是如何将刚发布不久的模型从modelscope或者huggingface转换成ollama上的文件的。
其实思路很简单,就是下载模型,然 …
qwen3最新的 qwen3-30b-a3b-2507感觉很棒,在8g显存的4060显卡上都能达到4-5tokens/s。

顺手把gguf生成,并且转成了ollama能用的q8量化版本,然后推送到了ollama的hub上面。
懒得折腾的同学,可以下载安装ollama,然后在终端运行下面的命令:
ollama run …
大胖哥 大胖哥
How to update all models #2633
https://github.com/ollama/ollama/issues/2633
参考Ollama的项目地址发现了 seanmavley 提供的单行指令在Shell里面运行一下就可以让Ollama更新当前所有本地模型:
ollama list | awk 'NR>1 {print $1}' | xargs -I {} sh -c 'echo "Updating model: {}"; ollama pull {}; echo "--"' && echo …