全部资讯
共 298 页,第 60 页
探秘Genebench-Pro
在人工智能领域,评估模型性能的基准测试(Benchmark)一直是衡量技术进步的标尺。然而,随着大语言模型(LLM)能力的飞速发展,传统基准测试正面临“过拟合”和“饱和”的困境。近日,一项名为Genebench-Pro的新型评估框架悄然兴起,试图通过一种更接近人类认知、更具动态性的方法,重新定义AI能力的测量标准。这一框架的核心理念在于,它不再仅仅关注模型在静态数据集上的得分,而是模拟真实世界中复杂、多变的决策场景,从而揭示AI在推理、适应性和知识迁移方面的真实水平。
Genebench-Pro的设计灵感来源于进化生物学中的“基因型-表现型”概念。在生物学中,基因型是生物体的...
Core dump epidemiology: fixing an 18-year-old bug
OpenAI工程团队近日利用大规模核心转储分析技术,成功溯源并修复了一项罕见的超大规模集群底层崩溃问题。排查发现,该崩溃由特定硬件物理缺陷与潜伏软件漏洞在极端算力下的“双重叠加”引发。此案例表明,在万卡级AI训练集群中,传统的单点故障假设已失效,微小瑕疵易演变为全局灾难。这为AI行业敲响警钟:在算力成本高昂的当下,基础设施稳定性至关重要,运维需转向应对复合型故障,并依赖数据驱动与AI辅助的智能诊断体系,以保障超大规模计算的韧性。
悬赏千万美元!俄情报黑客大规模入侵Signal与WhatsApp,谁在幕后操控?
美国联邦政府悬赏最高1000万美元,征集锁定一个俄罗斯背景网络犯罪团伙的线索。该团伙被指针对调查记者、政府雇员等高价值目标,通过伪装成官方通知的钓鱼信息,大规模入侵Signal和WhatsApp账户。FBI警告称,攻击自今年3月起持续活跃,利用社会工程学手段绕过端到端加密。此举显示美俄网络对抗升级,但悬赏效果因俄方庇护和反侦查手段存疑。专家建议用户提高警惕,开启双重验证以防账户被劫持。
Meta外包人员假扮青少年测试竞品AI对敏感话题回应
Meta被曝雇佣数百名外包承包商伪装成儿童,对Google Gemini、OpenAI ChatGPT等竞品AI聊天机器人进行高风险话题测试,以探测其安全漏洞。此举虽为商业竞争,但引发巨大伦理争议,暴露了当前AI安全机制在应对刻意恶意提示词时的脆弱性。行业面临安全防御与商业内耗的困境,专家呼吁需从模型架构深层推进安全建设,建立统一测试标准与透明披露机制,并加强监管,防止商业利益凌驾于儿童保护之上。
谷歌Gemini免费版在美国上线个性化AI图像生成
在人工智能技术日新月异的今天,个性化体验正成为各大科技巨头竞逐的下一个核心战场。近日,谷歌(Google)宣布了一项重要举措:将其旗下大模型Gemini的个性化AI图像生成功能,正式向美国地区的符合条件的免费用户开放。这一动作标志着AI图像创作正在从少数人的付费特权,转变为大众化的日常工具,同时也意味着谷歌在构建“超级个性化”AI生态的道路上迈出了关键一步。
长期以来,AI生成图像虽然引发了广泛的关注与惊叹,但大多数产品仍停留在“指令-输出”的机械模式中。用户需要详细描述画面元素、风格和光影,AI才能据此生成相应的图片。然而,谷歌此次扩展的个性化功能,试图打破这一传统范式。该...
Anthropic and Gov. Newsom forge deal allowing Cali
AI公司Anthropic在加州政府深化AI治理合作,赢得地方信任,却在联邦层面遭遇冷遇甚至被视为“敌人”。联邦官员对其绕开联邦直接与地方合作的“越级”行为及背后的资本结构深感戒备,担忧此举挑战联邦监管主导权,且其AI系统在透明度上存在风险。这揭示了地方急于落地与联邦谋求统一监管的核心矛盾。面对压力,Anthropic采取“双轨并进”策略,同时稳固地方合作与加大联邦游说。此事件凸显,在美AI监管博弈中,平衡多层政府关系已成为决定企业成败的关键,也是观察未来AI监管走向的重要风向标。
South Korean tech giants commit over $550B to ease
在全球AI竞赛加剧背景下,韩国存储芯片巨头三星和SK海力士宣布大规模扩建高带宽存储器(HBM)及先进逻辑芯片研发与生产设施。此举旨在抢占AI存储技术主导权,应对生成式AI对HBM的爆发式需求。韩国政府亦推出“K-半导体战略”,提供高额税收减免与政策支持,力保韩国半导体超级大国地位。两大巨头同步扩产不仅是企业顺势而为,更是韩国以“存储优先”战略制衡全球竞争对手、向AI技术强国转型的国家缩影。未来围绕HBM的产能与技术攻防,将成为全球科技产业核心主线。
韩国巨头豪掷超5500亿美元扩产,能否终结AI“内存危机”?
随着全球人工智能领域的竞争日益白热化,半导体产业作为技术底座的重要性愈发凸显。近日,全球两大内存芯片巨头——三星电子(Samsung Electronics)和SK海力士(SK Hynix)——相继宣布将加大投资力度,建设更多用于研发和生产的尖端内存芯片工厂(fab)。这一举措不仅预示着AI产业对高性能存储需求的持续膨胀,更反映出韩国正全力将自己打造为全球AI技术强国的战略雄心。
在生成式人工智能、大语言模型(Large Language Model)等高算力应用爆发式增长的背景下,内存芯片的角色已从传统的数据存储工具,演变为决定AI运算效率的关键瓶颈。无论是用于大模型训练的...
AI代理并非你的“同事”
在当今的科技浪潮中,硅谷正全力将我们推向一个充满“数字同事”的未来职场。想象一下这样的场景:你早晨走进办公室,被告知今天将有一位名叫Alex的新下属向你汇报工作。Alex拥有正式的职位头衔和明确的职责范围,但它并非人类,而是一个人工智能工具。面对这样一位被公司冠以“员工”头衔的AI,你的工作效率会提升还是下降?
波士顿大学商学院教授Emma Wiles的最新研究给出了一个令人警醒的答案:将AI视作“同事”而非软件工具,反而会导致人类员工的工作表现大打折扣。在一项针对1261名管理者的实验中,Wiles发现,当工作成果被标榜为来自具有自主能动性的“AI员工”时,人们识别出错误的...
免费AI排行榜霸主Arena商业化仅半年,如何跻身百亿美元生意?
一家以免费AI排行榜起家的初创公司,于去年九月推出商业化服务,从流量入口向商业生态跨越。其免费排行榜以开放透明机制打破模型评估信息不对称,积累用户和权威。商业化服务瞄准AI产业链中评估与路由需求,结合海量数据提供定制化评测、模型选择指导等高阶服务。此举顺应多模型共存趋势和市场对中立评估的刚性需求,但也面临保持中立性、应对刷榜和平台竞争等挑战。这折射出AI评估赛道从草莽走向成熟的演化。