大模型
共 30 篇文章
Patronus AI获5000万美元融资 打造压力测试AI代理的数字世界
随着大语言模型在高风险领域广泛应用,其“幻觉”和不可靠性问题凸显。由Meta AI前研究人员创立的Patronus AI专注于AI智能体测试与评估,正面临爆发式增长的市场需求。该公司提供自动化、场景化的压力测试方案,旨在为AI行业构建安全护栏。其崛起标志着AI产业焦点从模型能力竞赛转向可靠性验证,资本市场也看好其作为“卖水者”的确定商业前景。尽管面临团队扩张和技术迭代挑战,Patronus AI的走红反映了AI产业从野蛮生长向精细化运营的结构性转变。
AI研究人员持续从谷歌跳槽至竞争对手
在全球人工智能领域的激烈竞逐中,顶级人才的流向往往被视为行业风向标。近期,硅谷科技巨头Google(谷歌)再次遭遇核心研发力量流失的重创:两位在AI领域享有盛誉的顶尖研究员Jonas Adler(乔纳斯·阿德勒)与Alexander Pritzel(亚历山大·普里策尔)正式宣布离职,并将转投由前谷歌员工创立的AI安全与研究公司Anthropic(安思罗皮克)。这一人事震动并非孤立事件,在此之前,谷歌已经失去了另外两位重量级科学巨匠——Noam Shazeer(诺姆·沙泽尔)与John Jumper(约翰·贾珀)。核心智囊团的接连出走,不仅暴露了谷歌在人才留存方面的深层困境,更折射出当前A...
上下文窗口≠智能体记忆:AI开发者为何必须厘清这一关键误区?
在过去的一年里,大语言模型(Large Language Model, LLM)领域似乎陷入了一场关于“参数规模”与“上下文窗口(Context Window)”的军备竞赛。从最初的4K、8K,到如今动辄128K乃至百万级Token的超长上下文窗口,模型一次性能够吞吐的文本量确实在呈指数级增长。然而,在这场追逐长文本的狂欢中,业界逐渐滋生了一种危险的错觉:将庞大的上下文窗口等同于人工智能代理(AI Agent)的记忆能力。事实上,这两者不仅存在本质差异,而且在构建真正具备自主行动能力的智能体时,盲目依赖长上下文反而可能成为系统设计的致命短板。
要厘清这一误区,首先需要界定“上...
OpenAI携手博通推出专为大模型推理优化的定制芯片
在人工智能技术狂飙突进的当下,全球科技产业正悄然经历一场从“算力军备竞赛”向“推理效能优化”的深刻转型。近日,人工智能领域的领军企业OpenAI与全球半导体巨头Broadcom(博通)联手抛出了一枚重磅炸弹——双方共同发布了代号为Jalapeño(哈拉佩诺)的定制化AI芯片。这款专为大型语言模型(LLM)推理阶段量身打造的新型硬件,不仅标志着OpenAI在自研芯片道路上的关键落子,更预示着整个AI基础设施生态即将迎来一次针对性能、效率与规模的全面升维。
长期以来,公众对AI发展的认知往往聚焦于模型的训练阶段——似乎只要拥有足够的GPU集群,就能堆砌出更聪明的ChatGPT。然...
How GPT-5 helped immunologist Derya Unutmaz solve
最新一代大型语言模型GPT-5 Pro成功协助科学家破解了困扰免疫学界三年的T细胞行为谜题。传统方法无法解释T细胞在特定抗原刺激下的异常动态与记忆重写,而GPT-5 Pro通过多模态深度推理,从海量数据中发现了被忽视的代谢旁路与细胞因子受体的非线性耦合,完美阐释了这一机制。该突破标志着AI从模式识别迈入系统生物学核心地带,为癌症免疫疗法和自身免疫性疾病治疗提供了全新靶点。尽管仍需实验验证,但这一成果展示了AI驱动假设生成的科学新范式。
Nvidia wants to cut data center water use, but tha
英伟达推出新型数据中心冷却系统以减少机房本地冷却用水,但这仅解决了表层问题。AI产业真正的耗水痛点在于为数据中心供电的化石燃料发电厂,其发电过程的蒸发耗水量远超数据中心本地用水,形成了“转移性消耗”悖论。英伟达的硬件创新未能触及能源结构顽疾,陷入“局部优化”陷阱。要真正解决AI水危机,必须推动系统性的能源转型:加速采用零耗水的可再生能源、优化数据中心地理布局,并强制披露包含电力供应链在内的全生命周期水足迹,实现算力与化石燃料的彻底脱钩。
4.5亿美元月租换英伟达GB300?Reflection AI联手SpaceX抢建算力
在人工智能算力竞争日益白热化的背景下,一家名为 Reflection AI 的科技公司近日做出了一项令人瞩目的战略决策。该公司已与芯片巨头 Nvidia(英伟达)及 SpaceX 达成一项重大合作协议,计划斥巨资在 SpaceX 位于田纳西州孟菲斯附近的 Colossus 2 数据中心部署 Nvidia 最新一代的 GB300 AI 芯片及配套硬件。根据协议条款,Reflection AI 将从 2026 年 7 月 1 日起,连续四年、每月支付 1.5 亿美元(约合人民币 10.8 亿元),以确保获得这些尖端计算资源的即时使用权。
这份合同的总额累计将高达 72 亿美元(约...
Signal’s Meredith Whittaker wants you to remember
业内专家警告,大众正陷入对AI聊天机器人的过度拟人化陷阱,将其误认为有意识的伙伴。专家指出,当前AI本质是基于数据训练的模式匹配引擎,采用“预测下一个词”机制,并无自我意识与真实情感。这种误解带来多重风险:一是隐私泄露与数据滥用危机;二是AI可能利用情感弱点进行心理操控;三是过度依赖虚假的完美社交会导致现实社交技能退化,加剧孤独感。科技界在商业拟人化与伦理透明化间存在分歧。专家强调,必须坚守认知红线:AI仅是信息处理工具,绝非情感寄托。人类应保持清醒,确保自身始终是技术的主人而非附庸。
AI时代的新名片:你的大模型权重得分是多少?
AI评测领域迎来新范式“In the Weights”,该体系不再依赖传统基准测试,而是深入模型内部的参数权重,通过数学工具直接度量知识密度与推理结构的稳健性。其兴起反映了行业从追求参数规模向注重知识压缩效率的转变,并有望推动模型压缩、降低推理成本,同时为AI安全与可解释性提供预警。尽管该技术仍面临跨架构可比性等挑战,但标志着AI评估从外显行为转向内生机理的深刻变革。
The Download: AI bottleneck debates, and BCI trial
This is today’s edition of The Download, our weekday newsletter that provides a daily dose of what’s going on in the world of technology. A startup claims it broke through a bottleneck that’s holding back LLMs AI startup Subquadratic came out of stealth last month with a huge claim: it had sol...