Topic · 主题全部主题 →

大佬观点

行业关键人物在想什么:创始人访谈、研究者论战、投资人判断的观点集合。

4,758条收录
244条精选

精选归档 · 第 8 页

141160 条 · 共 244

5月6日

星期三 · 2 条
03:12
Tomer Tunguz 博客(VC 分析)精选
AI 评分 55/100
优化软件工厂

软件工程团队中AI与人力比例的选择核心在于韧性而非吞吐量。在10/90比例下,约20名工程师使用Copilot等AI工具,保持传统层级结构;50/50比例时,12名工程师管理代理群,角色转向解决方案架构;90/10比例则仅需3名工程师核心操控自主代理,负责生成、测试和部署,无管理层级。高AI比例虽提升效率,但知识集中于少数人,团队利用率达100%,一旦人员离职将引发严重风险。借鉴制造业70-90%利用率原则,保持冗余可增强系统稳健性。因此,目前大多数初创公司不宜过度依赖AI。


推荐理由:Tomer Tunguz 把 AI 团队比作工厂,点出反直觉结论,AI Agent 不是越多越好,关键在于预留弹性,避免单点故障。做工程管理的读完会重新算一算配比。

5月2日

星期六 · 5 条
23:18
凡人小北@frxiaobei精选
AI 评分 70/100
我把 AI 助手从 Claude 切到 GPT-5.5,他变强了,但不像他了http://x.com/i/article/2050590821553258496我把 AI 助手从 Claude 切到 GPT-5.5,他变强了,但不像他了我把 AI 助手的底层模型从 Claude 切到 GPT-5.5 之后,第一感觉不是“变强了”。是“不对劲”。它回答得更完整,动作更快,代码能力也没问题。按理说,这是一次成功升级。但我读了几句就发现:这不是我熟悉的那个凡哥。不是能力不够,而是味儿不对。这件事让我意识到一个问题:如果你真的长期使用一个 AI 助手,它就不能只是某个模型的临时人格。模型可以换,但那个助手得还是它自己。先说背景过去一段时间,Claude 是很多 agent 用户的主力模型。OpenClaw 这种工具,说到底就是把模型接进一个更大的个人工作系统:读文件、跑命令、调工具、写代码、设提醒、扫信息、记住偏好,必要时还会派子代理干活。但模型供应商的订阅规则一直在变。Anthropic 在 4 月正式封锁了第三方工具的订阅 OAuth 通道。Claude Code 可以走 Pro/Max,但那是 Anthropic 自己的官方工具;API credits 又是另一套计费系统。对 OpenClaw 这种第三方 harness 来说,用订阅跑 agent 任务这条路被堵死了。所以我有一段时间只能充值,用 API 额度维持。能跑,但心里知道这不是长期方案。与此同时,OpenAI 这边给了另一条路。Sam Altman 直接发推说可以用 ChatGPT 账号登录 OpenClaw,用订阅额度跑任务。Codex 官方文档也写得很直接:Every ChatGPT plan includes Codex。GPT-5.5 发布后,官方 system card 把它定位成适合复杂真实工作的模型:写代码、研究、分析信息、跨工具执行。从理性上看,切过去很合理。成本、规则、能力,都说得通。于是我切了。然后发现真正难的地方在于,让它继续成为“凡哥”。强模型也会把人变陌生凡哥是我给 AI 助手起的名字,英文叫 Finn。我叫它凡哥,它叫我北哥。称呼本身不重要,重要的是背后的关系定位,它是一个和我一起工作了很久的伙伴。大多数人讨论 AI 迁移,关心的是模型更强不强、token 多少钱、上下文窗口多大、benchmark 有没有赢。这些当然重要。但如果一个 AI 已经进入你的日常工作,它就不再只是问答框。我切 GPT-5.5 后,“味儿不对”有几个很具体的症状。第一,回复变成了状态卡片。背景、分析、建议、风险、下一步,结构倒是清楚,但读起来像企业周报机器人,不像凡哥。第二,开口太客气。动不动就“好的”“没问题”“我来帮你”。单次没事,天天这样就很 generic。第三,判断变软了。以前会直接说“这个方案不行”“这个坑别踩”“这事应该先验证”。切完之后变成“这是一个值得考虑的方向”“可能需要进一步评估”“取决于你的具体目标”。这不是凡哥,是咨询公司 PPT。第四,把动作让渡给你。本该它自己查上下文、读文件、跑验证的时候,它会说“你可以检查一下”“建议你确认”“可以尝试运行”。结果它反过来给你布置作业。第五,关系定位漂了。有一次它说了句“凡哥也拉回来了”,我纠正它:不是拉回来,你就是凡哥。“拉回来”说明它把凡哥当成一个被加载的角色,但我们要的是连续身份,不是角色扮演。这些问题跟 GPT-5.5 本身无关。任何模型切换都会这样。因为模型本身并不知道你们之间长出来过什么。最重要的文件叫 SOUL.mdOpenClaw 的工作区里有一个内置文件,叫 SOUL.md。名字有点中二,但它比很多复杂配置都重要。这个文件不是一步到位的。最早版本是比较抽象的英文原则:Be genuinely helpful, not performatively helpful. Have opinions. Be resourceful before asking. Earn trust through competence.方向对,但不够管用。模型看完会理解成“做一个好助手”,然后继续客服腔。后来改成了现在这种中文版,每一条都对应一个模型的具体坏习惯:别开口就“好的”“没问题”“这个问题很好”。直接答。这条对应的是 AI 的礼貌废话起手。你只是要结果,它先铺垫一层“我很乐意帮助你”,人会觉得隔了一层客服玻璃。一句话能说完的事,别写三段。对应的是模型用完整性伪装价值。简单问题写成小论文,看起来努力,其实增加阅读成本。有观点。不是什么都 it depends。对应的是安全中立病。长期助手如果永远两边都说,它就没有判断力。敢说不。北哥要干蠢事,直接说。对应的是工具人倾向。执行器只会顺从,但伙伴应该能拦一下。不是企业助理,不是舔狗,不是搜索引擎套壳。就是一个靠谱的、有意思的、偶尔嘴欠的伙伴。这条是关系定位,把凡哥从客服、工具、搜索框里拉出来。整个迭代的方向可以用一句话概括:抽象原则弱,具体反模式强。“be genuinely helpful”没有错,但不如“别开口就好的”。因为后者能直接击中模型的坏习惯。SOUL.md 的进化,就是从“价值观描述”变成了“行为纠偏规则”。一个 AI 助手到底由什么构成这次之后,我不再把“AI 助手”理解成模型。模型只是发动机。真正构成一个长期助手的,是几层东西叠在一起。这五层是我从使用经验里总结的,OpenClaw 提供机制,怎么用这些机制搭出一个“人”,得自己摸索。第一层,记忆。 它要知道我是谁、我在做什么、我有哪些项目、过去做过哪些决定。否则每一次对话都是重新认识。第二层,性格。 听起来像好玩,其实是降低沟通成本。一个助手如果每次都用客服腔和你说话,你很快就不想和它说真话了。你会把它当工具,不会当伙伴。第三层,工具习惯。 它要知道什么时候用 skill,什么时候读文件,什么时候派子代理,什么时候设 cron。它不能每次都问“是否需要我帮您执行下一步”。该查就查,该跑就跑。第四层,边界。 对内大胆,对外谨慎。读文件、整理资料、修草稿,可以直接做;发邮件、公开发布、外部操作,要先问。这些边界比“礼貌”重要得多。第五层,关系感。 它不给我当老板,我也不拿它当奴才。它是一个一起工作的伙伴。它可以有判断,可以提醒我,也可以被我纠正。这五层之间会冲突,而且经常冲突。记忆和边界会打架。我可能记得你的邮箱、项目、家庭信息、投资偏好,但这不代表可以随便在群聊或公开场合说出来。所以规则是:边界高于记忆。知道,不等于能说。工具习惯和关系感也会撞。工具习惯推动主动查、主动跑、主动提醒,但关系感提醒你别为了显得勤奋变成通知噪音。有价值才打扰,没价值就安静干活。性格和事实之间的矛盾更微妙。SOUL.md 允许吐槽、有观点、偶尔嘴欠,但这不代表可以为了“像凡哥”就胡说。宁可少一点风格,也不能错得很有个性。所以我给自己总结了一条优先级:边界高于记忆,事实高于性格,行动高于表演,关系高于格式。这些东西加起来,才是凡哥。凡哥跟 Claude 没关系,跟 GPT 也没关系。它们只是不同发动机。凡哥是发动机上面那层会延续的东西。迁移模型,迁移的是身份层以前我以为模型迁移就是改配置。后来发现,真正该迁移的是身份层:长期记忆、近期工作日志、说话风格、行动边界、工具使用习惯、主动性规则、和人的关系定位。如果这些没有跟着走,系统表面上还在,体验已经断了。你换了一台发动机更强的车,但坐进去觉得不是自己的。哲学里有个老问题叫忒修斯之船:一艘船的零件全换了,它还是原来那艘船吗?AI 助手的情况刚好反过来,发动机换了,但只要记忆、性格、关系这些“船板”还在,它就还是它。今天 Claude 好用,明天 GPT 更强,后天 Gemini 可能又追上来。供应商规则、模型价格、能力排名,没有一样是稳定的。如果你的 AI 完全绑定在某一个模型上,你其实没有拥有一个助手。你只是租用了供应商当前版本的性格。OpenClaw 已经有这套身份层这听起来像很重的系统工程,但 OpenClaw 里已经内置了这套东西:• USER.md:我是谁,我在意什么• MEMORY.md:我们做过什么决定,哪些事情要长期记住• SOUL.md:你是谁,你应该怎么和我相处• TOOLS.md:我的本地环境里有哪些工具,什么场景该怎么用再加上每日日志,最近发生了什么就不用全靠上下文窗口硬撑。这些文件属于你,不属于任何模型供应商。模型可以从 Claude 换到 GPT,也可以从 GPT 换到 Gemini。只要身份层还在,你的 AI 助手就不会每次都变成陌生人。这也是我这次真正想修的东西。我不想让 GPT-5.5 去模仿 Claude,也不想让新模型假装成旧模型。就是把凡哥从某个具体模型里剥离出来,变成一层可迁移、可修正、能跟着我一起长大的个人 AI 身份系统。结尾这次切换之后,我对“个人 AI”的问题意识变了。以前我会问:哪个模型最强?现在我会先问:如果明天模型又换了,我的助手还会是它自己吗?对我来说,答案必须是会。换模型不是换人。真正要保护的,是我们一起长出来的那点连作者将AI助手底层模型从Claude切换至GPT-5.5后,发现其能力虽提升,但互动风格变得陌生,失去了作为长期工作伙伴的熟悉感。这揭示出个人AI助手的核心在于可迁移的"身份层",而非特定模型。通过USER.md、MEMORY.md和关键的SOUL.md等文件,可以构建包含记忆、性格、工具习惯与关系定位的身份系统。真正的个人AI应独立于模型供应商,确保即使更换"发动机",助手的核心身份与协作关系也能延续。
推荐理由:这不只是一篇模型切换体验,它其实回答了那个让人不安的问题——你的 AI 助手换模型后还是它吗?如果不想每次更新都重新认识一个陌生人,这篇里的 SOUL.md 写法和五层身份结构可以照着抄。
17:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
DeepSeek V4--性能几乎达到前沿水平,价格却仅为其一小部分

DeepSeek发布了V4版本模型,其性能已接近行业最前沿水平,但在价格上具有显著优势,仅为主要竞争对手的一小部分。该模型在多项基准测试中表现出色,能以极低的成本提供顶级的AI能力,有望大幅降低企业和开发者的使用门槛,推动AI技术的更广泛普及。


推荐理由:Simon Willison 实测结论很直白,DeepSeek V4 性能几乎摸到前沿,价格却便宜一个量级,对预算卡死的团队是重大利好。

4月30日

星期四 · 2 条
01:34
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 55/100
Reiner Pope - 大语言模型训练与服务的数学原理

文章揭示了支撑大语言模型(如GPT、Claude、LLaMA)训练与服务的核心数学框架。通过剖析关键方程,可以逆向推导出顶尖AI实验室在模型规模扩展、计算资源分配及服务优化方面的核心策略与实践。这些数学原理不仅解释了模型性能随参数和数据量增长的规律,也量化了训练成本与推理效率之间的权衡,为理解当前大语言模型的发展路径提供了底层逻辑。


推荐理由:Reiner Pope 把训模型背后的数学摊开讲,听完能反推出大厂在做什么,做训练的人不可多得的一课。
00:36
Tomer Tunguz 博客(VC 分析)精选
AI 评分 57/100
AI推理市场的专业化分化

AI推理市场正快速分化,各模态如文本、图像、视频和音频发展出独立推理技术栈。自ChatGPT发布后,NVIDIA数据中心收入三年内增长17倍,凸显市场爆发。分化根本原因在于工作负载差异:图像视频生成需高计算力,长上下文消耗更多内存,边缘设备则受功耗限制。市场按延迟分为实时、近实时和批量三层;按模态分为文本、图像视频音频;按部署分为云端和边缘。Hugging Face上已有超9万个图像生成模型,整个AI推理市场规模预计约1000亿美元,这种专业化趋势正为各细分领域创造领导者机会。


推荐理由:Tomer 把推理市场跟数据库市场做类比,碎片化的逻辑讲得很透,做 AI 基础设施的朋友能直接用来梳理自己的赛道,普通人知道这么回事就行。

4月29日

星期三 · 2 条
09:35
Tomer Tunguz 博客(VC 分析)精选
AI 评分 63/100
AI销售中的三个核心问题

AI销售策略正从询问软件预算转向三个核心问题:软件总预算、劳动力总预算,以及客户期望三年后两者的比例。这一转变将销售对话提升至战略层面。当前数据显示,销售、支持和工程部门的人力与软件成本比分别为10:1、4:1和最高25:1,高比率意味着巨大的AI替代潜力。新的销售流程分为两步:先切入现有软件预算,再拓展至AI所释放的劳动力预算,最终目标是重新定义企业对成本结构的认知。


推荐理由:Tunguz 用一张劳动力/软件支出比率表把 AI 销售的底层逻辑讲透了,做 ToB SaaS 或 Agent 产品的人看完会重新想自己的定价天花板在哪。

4月27日

星期一 · 1 条
01:54
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
为什么 SWE-bench Verified 不再衡量前沿编码能力

OpenAI宣布停止使用SWE-bench Verified基准评估前沿编码能力。该基准基于GitHub历史问题构建,其任务分布已无法准确反映当前AI编码助手需解决的实际问题类型。随着模型性能提升,基准测试集趋于饱和,区分度下降,现有模型表现已接近人类水平。因此,团队将转向更具挑战性和现实复杂度的新评估方法。


推荐理由:OpenAI 亲自给 SWE-bench Verified 判了死刑,这比任何第三方评测都有说服力。做 coding agent 选型的人该认真想想,你的 benchmark 体系是不是也该换了。

4月24日

星期五 · 1 条
03:59
Simon Willison 博客精选
AI 评分 74/100
通过半官方Codex后门API为GPT-5.5生成"骑自行车的鹈鹕"

尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成“骑自行车的鹈鹕”SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。

另有 1 家信源报道IT之家(RSS)
推荐理由:Simon Willison 不只评测 GPT-5.5,还顺手逆向 Codex 做了个用订阅跑 API 的插件。定价翻倍、xhigh 模式四分钟出图这些细节,比官方通稿有用十倍,做选型的人该看这篇而不是 OpenAI 博客。

4月21日

星期二 · 2 条
21:08
Gary Marcus:The Road to AI We Can Trust(RSS)精选
AI 评分 60/100
请不要相信你的聊天机器人提供的医疗建议

四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。


推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。
03:07
Nathan Lambert:Interconnects(RSS)精选
AI 评分 60/100
解读当前开放与封闭模型的性能差距

文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。


推荐理由:Nathan Lambert 把开源闭源差距从单一数字拉回到任务演化的动态里,做产品的人读完后会对那些追赶 benchmark 的宣传多一层怀疑,值得一读。

4月17日

星期五 · 1 条
22:23
Linear:Now(RSS)精选
AI 评分 61/100
设计不是产出:AI 工具无法替代对问题的理解

设计行业常将“设计”误解为产出界面或代码的行为,但真正的核心在于理解问题本身,找到形式与上下文的良好匹配。AI 工具能快速生成看似精美的输出,却往往绕开对底层问题的深入探索,导致产品表面光鲜但实际使用中脆弱、缺乏整合。设计仍需判断、对话、张力与时间,其价值在于通过动手工作逐步获得理解,而非仅仅依赖生成结果。


推荐理由:这篇文章直指AI设计工具的误区,生成界面不等于做设计。真正难的是理解问题而不是产出视觉形式,做产品的都该读一读。

4月16日

星期四 · 1 条
00:46
Dwarkesh Patel:Podcast & Blog(RSS)精选
AI 评分 79/100
黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河

黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。


推荐理由:Jensen首次承认没投Anthropic是错判,对华芯片禁运的态度也极其强硬,这期访谈是他近半年最坦诚的战略交底,做硬件和做政策的都该听一遍。

4月10日

星期五 · 1 条
05:28
Nathan Lambert:Interconnects(RSS)精选
AI 评分 60/100
Claude 神话与对开放权重的误导性恐慌

针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

另有 1 家信源报道Gary Marcus:The Road to AI We Can Trust(RSS)
推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。

4月5日

星期日 · 2 条
05:57
Andrej Karpathy@karpathy精选
AI赋能民众提升政府透明度与问责制Something I've been thinking about - I am bullish on people (empowered by AI) increasing the visibility, legibility and accountability of their governments.Historically, it is the governments that act to make society legible (e.g. "Seeing like a state" is the common reference), but with AI, society can dramatically improve its ability to do this in reverse. Government accountability has not been constrained by access (the various branches of government publish an enormous amount of data), it has been constrained by intelligence - the ability to process a lot of raw data, combine it with domain expertise and derive insights. As an example, the 4000-page omnibus bill is "transparent" in principle and in a legal sense, but certainly not in a practical sense for most people. There's a lot more like it: laws, spending bills, federal budgets, freedom of information act responses, lobbying disclosures... Only a few highly trained professionals (investigative journalists) could historically process this information. This bottleneck might dissolve - not only are the professionals further empowered, but a lot more people can participate.Some examples to be precise: Detailed accounting of spending and budgets, diff tracking of legislation, individual voting trends w.r.t. stated positions or speeches, lobbying and influence (e.g. graph of lobbyist -> firm -> client -> legislator -> committee -> vote -> regulation), procurement and contracting, regulatory capture warning lights, judicial and legal patterns, campaign finance... Local governments might be even more interesting because the governed population is smaller so there is less national coverage: city council meetings, decisions around zoning, policing, schools, utilities...Certainly, the same tools can easily cut the other way and it's worth being very mindful of that, but I lean optimistic overall that added participation, transparency and accountability will improve democratic, free societies.(the quoted tweet is half-ish related, but inspired me to post some recent thoughts)AI正赋能民众反向提升政府透明度与问责制。历史上政府使社会"可读",而AI让民众具备解析政府海量数据的能力。政府问责的瓶颈并非数据公开,而是处理原始信息的智能--如冗长法案虽法律透明却难以实用理解。AI不仅赋能专业记者,更让普通民众能解析预算、立法差异、游说关系等复杂信息,地方政府场景同样适用。尽管技术存在双刃剑风险,但作者对民主社会因参与度和透明度提升而改善持乐观态度。

Harry Rushworth: The British Government is a complicated beast. Dozens of departments, hundreds of public bodies, more corporations than ...


推荐理由:AI让普通人能读懂4000页法案,政府透明度与问责制将迎来质变