
A | 家人们,就在刚刚,Google正式发布了Gemini 3.6 系列模型! 这次登场的一共三个模型: 面向普通用户和开发者推出的通用模型 Gemini 3.6 Flash: 输出 token 消耗减少了约 17%,在 DeepSWE 上最高减少 65% 输入:1.50 美元/百万 token 输出:7.50 美元/百万 token 主打低成本和高吞吐的 Gemini 3.5 Flash-Lite: 输入 $0.30/百万 token 输出 $2.50/百万 token 面向网络安全场景的 Gemini 3.5 Flash Cyber: 定价还没曝光,目前只给政府和还有Google定的受信任的合作伙伴限量开放 在正式开始详细介绍前,先给大家打一针预防针: 如果只看跑分,这次更新可能没有想象中那么炸裂—Gemini 3.6 Flash 的综合智能水平与上一代基本持平,代码能力也没有横扫同级模型,但是效率绝了! Gemini 3.6 Flash Gemini 3.6 Flash 是 Gemini 3.5 Flash 的升级版,也是这次发布的主角。 根据 Artificial Analysis 的发布前测试,Gemini 3.6 Flash 在 Intelligence Index 上拿到了50 分,与 Gemini 3.5 Flash 持平(Ps:从综合智能表现来看,可以说完全没有实现代际跃升): 在Gemini最擅长的知识类工作的基准GDPval-AA v2 上取得 1421 Elo,比上一代高 72 分: 它真正值得一说的提升,在速度和效率上。 Gemini 3.6 Flash 完成单项任务的平均时间从 2.7 分钟降至 1.3 分钟,缩短了一半以上;输出速度达到 每秒 304 个 token。与此同时,它的输出 token 消耗减少约 17%,在 DeepSWE 等特定任务上,降幅最高可达 65%。 虽然没有更聪明,但是确实做到了能用更少的 token、更短的时间完成同样水平的工作。

B | Gemini 3.5 Flash-Lite Gemini 3.5 Flash-Lite 面向的是另一类需求:高并发、低延迟和大批量任务。 메모리 안에 연산기 넣어 데이터 이동 최소화‘라마3.1’ 모델 실증…토큰 생성속도 3배↑기존 제어장치 활용해 상용화 문턱도 낮춰 0.65㎜(밀리미터) 두께의 삼성전자 7세대 저전력 D램(LPDDR5X). 삼성전자삼성전자(005930)가 메모리 내부에서 연산 기능을 수행하는 프로세싱 인 메모리(PIM) 기술을 통해 인공지능(AI) 답변 생성 속도를 3배 이상 끌어올렸다. AI 반도체 성능 경쟁이 그래픽처리장치(GPU)의 연산 능력을 높이는 데서 나아가 데이터 이동 시간을 줄이는 방향으로 확대되고 있다는 분석이다.26일 업계에 따르면 삼성전자는 25일(현지 시간) 미국 스탠퍼드대에서 열린 ‘핫칩스 2026’에서 LPDDR5X 기반 프로세싱 인 메모리(PIM)의 실제 AI 추론 성능을 공개했다.PIM은 메모리 내부에 연산 기능을 탑재하는 기술이다. 데이터를 저장하는 역할에 머물던 메모리가 일부 계산까지 직접 처리해 프로세서의 부담을 줄이는 방식이다.기존 AI 반도체 구조에서는 메모리에 저장된 데이터를 GPU가 가져와 연산한 뒤 다시 메모리로 보내는 과정을 반복한다. 반면 PIM은 메모리 내부에서 필요한 연산 일부를 처리해 데이터 이동 거리를 줄인다. 이를 통해 처리 속도를 높이고 전력 소비도 낮출 수 있다.삼성전자는 저전력 더블 데이터 레이트 5X(LPDDR5X)-PIM에 16개 D램 뱅크마다 하나의 PIM 블록(연산회로 묶음)을 배치해 총 16개의 연산 블록을 탑재했다고 밝혔다. 뱅크는 데이터를 나눠 저장하는 D램 내부의 독립적인 저장 공간으로, 각 뱅크가 동시에 연산을 수행할 수 있도록 설계했다.이번 발표의 핵심은 실제 제작한 반도체에서 AI 모델 성능 향상을 검증했다는 점이다. 삼성전자는 자체 개발한 엣지 AI 가속기 시스템온칩(SoC)에 기존 LPDDR5X와 LPDDR5X-PIM을 각각 연결하고 메타의 거대언어모델(LLM) ‘라마 3.1 8빌리언(B)’을 구동했다. ‘생각하는 메모리’인 프로세싱 인 메모리(PIM) 구조 설명자료. 삼성전자그 결과 LPDDR5X-PIM의 토큰 생성 속도는 초당 81.3개로 기존 LPDDR5X(27개) 대비 3.01배 빠른 것으로 나타났다. 같은 작업에 걸리는 시간도 12.3초에서 5.4초로 줄었다.토큰은 AI가 답변을 생성할 때 사용하는 글자나 단어 단위의 데이터 조각이다. 동일한 AI 모델을 사용하더라도 메모리 구조를 개선하면 추론 속도를 크게 높일 수 있다는 의미다.삼성전자는 앞서 LPDDR5X-PIM 시제품과 기본 성능을 공개해왔다. 이번 발표는 실제 반도체 칩에 상용 AI 모델을 적용해 성능 개선을 확인하고, 내부 연산 구조까지 구체적으로 공개했다는 점에서 의미가 있다.상용화를 고려한 설계도 적용했다. 삼성전자는 주소정렬모드(AAM)를 활용해 LPDDR5X-PIM이 기존 D램 메모리 컨트롤러를 그대로 활용할 수 있도록 했다. 메모리 컨트롤러는 프로세서와 메모리 사이에서 데이터 입출력을 관리하는 장치다. PIM 적용을 위해 기존 시스템 구조를 전면 개편해야 하는 부담을 낮춘 것이다.삼성전자는 차세대 LPDDR6-PIM의 국제반도체표준협의기구(JEDEC) 첫 정식 규격도 최종화 단계에 가까워졌다고 밝혔다. 특정 업체만 사용하는 기술을 넘어 다양한 시스템 업체가 활용할 수 있는 표준 메모리 기술로 확대하겠다는 계획이다.업계 관계자는 “삼성전자가 세계적인 반도체 학회 핫칩스에서 선보인 LPDDR5X-PIM은 메모리가 위치한 곳에서 AI 연산 일부를 직접 처리하는 구조적 변화”라며 “AI 반도체 경쟁도 이제 GPU의 연산 속도를 높이는 것뿐 아니라 데이터를 얼마나 효율적으로 이동시키고 처리하느냐가 중요한 단계로 넘어가고 있다”고 말했다.。 它在 Intelligence Index 上取得 36 分,相比 Gemini 3.1 Flash-Lite 的 25 分提升了 11 分。 进步最明显的是智能体相关评测:GDPval-AA v2 提高 498 分,TerminalBench v2.1 提高 22.5 个百分点,Tau3-Banking 提高 7.8 个百分点。

C | 速度同样是它的核心卖点,平均每任务用时从 1 分钟降至 0.6 分钟,输出速度达到 每秒 350 个 token。

D | 不过,Gemini 3.5 Flash-Lite 的单次任务成本不降反升,从 0.04 美元增至 0.09 美元。 主要原因是输入和输出价格分别从每百万 token 0.25 美元和 1.50 美元,上调至 0.30 美元和 2.50 美元。尽管平均每任务的输出量已从 2 万 token 降至 1.3 万 token,但仍不足以抵消价格上涨带来的成本增加。 Gemini 3.5 Flash Cyber 除了两款通用模型,Google 这次还公布了一个更垂直的成员:Gemini 3.5 Flash Cyber。 CodeMender 是 Google 的代码安全代理,主要任务就是是在代码中发现安全漏洞,并进一步生成和验证修复方案。这次出的Gemini 3.5 Flash Cyber 将作为CodeMender的核心模型,服务于漏洞查找与修复流程。 按照 Google 的说法,它在代码安全任务上的表现达到了非常具有竞争力的前沿水平,并且运行成本也低于体量更大的模型。 Gemini 3.5 Flash Cyber 更像是 Google 对“专业模型+智能体”路线的一次验证: 以更轻量的 Flash 为底座,通过安全领域优化和专用代理,把模型能力集中到一个明确的高价值任务上。 安全代理往往需要持续扫描大型代码库、分析大量上下文,并反复验证修复结果。相比一味调用最强、最大的通用模型,针对网络安全任务优化的轻量模型,更有可能在能力、响应速度和运行成本之间取得平衡。不过,Gemini 3.5 Flash Cyber 暂时不会向所有开发者开放。

E | 它将通过 CodeMender 独家提供,仅面向受信任的合作伙伴开展有限访问试点。 单看代码表现 在 Arena 公布的前端代码竞技场排名中,Gemini 3.6 Flash 以 1537 分位列第 12 名,相比 Gemini 3.5 Flash 的第 21 名有明显进步。 结语 目前,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正在 Gemini App 中陆续上线,开发者也可以通过 Google AI Studio 和 Android Studio 的 API 使用新模型。

F | 至于正在内测的 Gemini 3.5 Pro,以及已经开始训练的 Gemini 4,或许才是 Google 留给下一次能力跃升的真正看点。 最后,关于 Google 这次发布,我还有几句话想说 过去的大模型发布,最容易传播的是跑分又涨了多少,但是这几次跟Google家感觉已经不恋战了。它已经不太愿意继续纠缠于单纯的跑分竞争了。 Gemini 3.6 Flash 交出的依然还是近两年非常具有Google味儿的答卷: 综合智能分数可以不变,只要任务速度翻倍、token 用量减少、输出价格下降,模型依然能够获得非常实际的竞争力。 可能有人会问:是不是 Google 已经卷不动了? 但在我看来,这更像是大模型竞争进入下半场的一个信号。 当头部模型之间的能力差距逐渐缩小时,开发者真正关心的问题会越来越具体:同一个任务需要等多久?一次调用要花多少钱?长上下文是否稳定?能不能支撑大规模并发? 从这个角度看,Gemini 3.6 Flash 是 Google 又一次明确面向落地效率的升级。
Current article:http://www.hanninhuaxituochunkui.pics/list_5uxm/3y93io.pptx
Published on:06:41:26
国内/08-20
国内/08-24
国内/08-21
国内/08-25
国内/08-24
国内/08-22
国内/08-20
国内/08-24
国内/08-22