首页»版块 更多荣耀手机 荣耀Robot Phone 【评论赢京东卡】重塑交互想象!全场景触控与语音方案大 ...
#星火共创营#

【评论赢京东卡】重塑交互想象!全场景触控与语音方案大征集

    [复制帖子标题和链接]

1.4万79

数码爱好者  LV8  发表于 9-4 01:52:09 江苏 来自:荣耀Magic7 Pro
【YOYO交互优化建议】声波朝向+距离感知双重过滤,降低语音助手误唤醒概率

一、现存痛点

日常使用手机过程中,YOYO误唤醒是很常见的困扰:
身边电视播放声音、旁人聊天、环境杂音,或者用户只是随口和别人交谈,并没有打算呼叫助手,YOYO却被意外唤醒,弹出界面打断当前操作。

现有的误唤醒过滤大多只依靠声音频谱、唤醒词文本做判断,无法区分:这句话是不是用户对着手机讲的。
有时候人就在手机旁边,但是是跟旁边的人对话,并不是跟手机说话,依旧会触发唤醒,影响使用体验。

二、核心构想

在语音唤醒的前置判断环节,增加AI声源分析能力,解析输入语音的两个关键信息:声音传播朝向(嘴巴指向)、声源和手机的距离,做分层过滤。

1. 声波朝向判断
通过麦克风阵列分析声波到达各个麦的时间差,AI推算说话人嘴巴大致朝向,判断说话人是否面向手机方向。
如果声源朝向明显偏离手机,说明用户是在和旁人交谈,不是对手机下达指令,直接排除这次唤醒判定,不触发YOYO。

2. 声源距离作为例外兼容
如果说话人距离手机非常近,哪怕脸部没有正对手机(侧着脸、低头),依旧允许参与唤醒识别。
比如躺在床上侧躺玩手机,嘴巴没有正对屏幕,但离手机很近,依然可以正常唤醒,避免过度过滤造成唤不醒。

3. 设置项交给用户自定义调节
在YOYO设置页面提供可调选项,用户可以按需修改过滤强度:

- 严格模式:优先依据朝向过滤,只有面向手机才更容易唤醒,抗误唤醒更强;

- 宽松模式:弱化朝向权重,主要依靠唤醒词+距离识别,适合经常侧躺、歪头使用手机的场景;
同时可以开关“声源朝向过滤”这个总功能,不想使用该特性可以直接关闭,回归原有唤醒逻辑。

三、完整工作逻辑流程

1.麦克风拾取环境声音,检测到疑似唤醒词;
2.AI同时计算两项信息:声源距离、声波入射朝向;
3.判断分支:
①距离近:无论朝向,允许进入唤醒校验流程;
②距离较远:必须声源朝向大致对着手机,才允许继续唤醒判定;朝向偏离直接拦截,不唤醒;
4.再叠加原有唤醒词置信度模型,多重校验,最终决定是否真正唤醒YOYO。

简单概括:
离得近,侧着说也能唤醒;离得远,不对着手机说话就不唤醒。

四、落地约束与边界

1. 硬件依赖:该功能需要多麦克风阵列支持,单麦克风机型无法解析声音朝向,该功能自动置灰不可开启。
2.置信降级保护:遇到嘈杂环境、回声遮挡,朝向判断置信度低的时候,自动放弃朝向过滤,沿用旧逻辑,防止出现该唤却唤不起来。
3.不改动原有唤醒核心模型,只是增加前置过滤层,属于增强优化,不是替换原有方案。
4.全部本地端侧处理,语音数据不上云,保护隐私。
5.提供开关和档位,充分尊重用户使用习惯,避免算法过度干预造成助手难唤醒。

五、方案带来的收益

1.大幅度降低电视人声、远处旁人交谈带来的误唤醒;
2.兼顾特殊使用场景,侧躺、低头近距离使用手机依旧可以正常唤醒,不会一刀切;
3.用户可以自主调节严格程度,不同使用习惯都能适配;
4.复用麦克风阵列硬件,不需要新增硬件,属于算法层面优化。

总结

传统唤醒只听“说了什么词”,本方案增加判断“是不是对着手机说的”。
利用麦克风阵列解析声源距离与声波朝向,远距离非面向手机的对话直接拦截,近距离放宽朝向限制,同时开放档位给用户自定义,做到减少误唤醒,又不误杀正常唤醒场景,提升YOYO日常使用体验。

希望研发团队评估参考!
荣耀小达人丶团子 荣耀答答团  发表于 9-4 10:42:37 湖南 来自:PC-VOC
本帖最后由 荣耀小达人丶团子 于 2026-9-5 17:53 编辑
数码爱好者 发表于 2026-9-4 01:52
【YOYO交互优化建议】声波朝向+距离感知双重过滤,降低语音助手误唤醒概率

一、现存痛点


层主您好,感谢您反馈的建议,我们也是会不断完善优化相关功能。希望后续荣耀给您带来更好的使用体验,感谢您的支持与理解
浪迹天涯任我飞  LV7  发表于 9-6 14:55:47 北京 来自:荣耀Magic7 Pro
1. 从“人找功能”升级为“设备懂需求”

现在手机、平板、PC、智慧屏等设备功能越来越丰富,但功能越多,用户反而越容易遇到“知道有这个功能,却不知道在哪里”的问题。建议未来的人机交互可以从传统的菜单式、图标式操作,逐渐转向“意图理解”。比如我说一句“帮我把刚才看到的资料整理一下”,系统不需要用户再进入文件、复制、粘贴、分类等多个步骤,而是能够自动识别相关内容,并询问用户是否需要整理成文档、表格或者笔记。真正做到“用户表达需求,设备完成任务”。

2. 打造真正意义上的多模态交互

未来的人机交互不应该局限于触控、语音或者键盘鼠标中的某一种方式,而应该让触控、语音、视觉、手势等方式自然融合。比如用户在电脑上看到一张复杂的数据图表,可以直接指着某个区域说“这里的数据帮我分析一下”,系统通过视觉识别+语音理解,就能准确定位用户指向的位置并进行分析。对于手机和平板,也可以支持“看图说话”“圈选即问”“指哪里问哪里”等交互方式,让AI真正理解用户当前正在看的内容。

3. 建立跨设备的“连续交互”体验

手机、平板、PC、穿戴设备等设备之间不应该是相互独立的,而应该形成一个完整的交互体系。例如用户在手机上浏览一篇文章,回到电脑后可以直接继续阅读;在平板上编辑到一半的文档,坐到电脑前能够自动接续;手机接收到一个重要通知后,可以根据用户当前使用的设备选择最合适的方式提醒。更进一步,可以建立“任务接力”机制:手机负责采集信息,平板负责处理和展示,PC负责深度编辑,设备之间自动完成任务流转。

4. 让AI具备“上下文记忆”,而不是每次重新开始

目前很多AI交互最大的问题是“每次对话都像第一次见面”。建议在人机交互中加入更加完善的上下文理解能力。例如用户说“把这个做得简洁一点”,系统应该知道“这个”具体指什么,而不是要求用户重新上传文件。又比如用户连续提出“换一个风格”“再正式一点”“增加几个方案”,AI应该能够理解这些指令是在修改刚才的内容。这样才能真正降低交互成本,让人与设备之间的沟通更加接近人与人之间的交流。

5. 增加“视觉理解+屏幕操作”的交互模式

可以设计一种类似“AI看屏幕”的交互方式。用户只需要圈选屏幕中的某一个区域,然后直接说“把这个价格加入预算”“把这张图片里的电话号码保存下来”“把这里的数据做成表格”,系统就可以直接执行。这样可以避免用户在不同应用之间来回切换。尤其对于办公、学习、购物、旅行等场景,这种交互会非常实用。

6. 让语音交互从“语音助手”变成“语音操控中心”

语音助手不能只停留在“查天气、设闹钟、播放音乐”这些简单任务上。未来可以进一步支持连续复杂指令。例如用户说:“帮我把今天收到的会议资料找出来,提取会议时间和地点,然后加入日程,并提醒我提前半小时出发。”这实际上涉及文件搜索、信息提取、日程管理、提醒设置等多个环节。如果系统能够一次理解并完成整个流程,人机交互效率会有明显提升。

7. 根据不同场景自动切换交互方式

同一个用户在办公室、开车、运动、做饭、会议等不同场景下,对交互方式的需求完全不同。因此可以建立“场景感知交互”。例如开车时减少视觉操作,以语音为主;会议时自动降低无关通知,只突出重要信息;运动时通过耳机或手表进行语音反馈;办公时则自动切换到键盘、鼠标和大屏协同模式。真正做到“设备适应人”,而不是“人适应设备”。

8. 增加更自然的手势交互

除了传统的点击、滑动,还可以进一步探索隔空手势、双指捏取、手掌翻转、指向操作等方式。例如演示PPT时,不需要触碰电脑,只需要挥手即可翻页;做菜时双手沾满东西,可以通过语音+手势控制播放、暂停和下一步;观看视频时可以用简单手势调整音量。手势交互如果能够结合摄像头和AI视觉识别,应用场景会非常丰富。

9. 建立“可解释的人机交互”机制

AI越来越主动以后,也要避免出现“自作主张”的情况。建议所有涉及重要操作时,都增加清晰的确认机制。例如删除大量文件、发送邮件、支付、修改重要资料等操作,AI可以先告诉用户:“我准备执行以下3项操作”,由用户确认后再执行。这样既提高效率,也让用户始终拥有最终控制权。

10. 让设备主动,但不能过度打扰

未来设备应该从“被动响应”向“主动服务”发展,但主动不等于不停弹窗。建议建立“打扰等级”和“重要程度判断”。例如用户正在玩游戏时,普通通知自动静默;检测到用户正在开会时,只保留电话、日程等重要信息;如果检测到用户连续搜索某个旅行目的地,可以适当提供路线、天气、住宿等信息,但不能频繁推送。AI应该做到“该出现的时候出现,该安静的时候安静”。

11. 打造“一个入口,完成多应用任务”

现在很多操作最大的痛点不是功能不存在,而是应用之间彼此割裂。比如订机票需要打开一个App,查天气又要打开另一个App,再把时间复制到日历中。未来可以通过系统级AI建立统一任务入口,用户只需要说“帮我规划一下周末旅行”,系统就可以调用地图、天气、日历、相册、备忘录等能力完成任务。用户不需要关心后台到底调用了哪些应用,只需要关注最终结果。

12. 针对不同人群设计个性化交互

老人、儿童、年轻人以及专业用户对于交互的需求不同。可以允许用户自定义交互模式,例如老人模式强化语音、大字体和简单操作;儿童模式强化图形化和互动式引导;专业用户则可以使用快捷指令、自动化流程和复杂多任务操作。甚至可以让系统根据用户长期使用习惯,逐渐学习用户偏好的操作方式。

13. 把“无障碍交互”融入普通产品设计

无障碍不应该只是针对少数特殊人群,而可以成为所有用户都能受益的设计。例如语音转文字、文字转语音、实时字幕、视觉识别、物体识别等功能,在特殊情况下同样非常有价值。比如环境嘈杂时可以使用字幕,双手不方便时可以使用语音,光线不好时可以依靠视觉增强。这样的人机交互才真正具有普适性。

14. 探索“预测式交互”

如果设备能够理解用户习惯,就可以进一步预测下一步需求。例如每天固定时间出门,手机可以提前提醒天气和交通情况;经常在某个时间查看工作资料,可以自动整理相关内容;会议结束后自动生成会议纪要并询问是否发送给参会人员。关键是这种预测必须建立在用户授权基础上,同时提供关闭和调整选项。

15. 最终目标是让交互“消失”

我认为未来最好的交互,不一定是增加更多按钮,而是让用户越来越少地操作按钮。用户说一句话、做一个动作、甚至只是表达一个意图,设备就能够理解并完成后续工作。手机、平板、PC、AI眼镜、耳机等设备也不再是孤立的产品,而是共同组成一个“智能交互空间”。

总体来说,我期待的人机交互不是简单地从“触控”变成“语音”,而是从“操作设备”真正升级到“与设备协作”。未来可以重点围绕“自然语言+视觉识别+手势+语音+跨设备协同+场景感知+AI主动服务”进行融合,让用户不需要学习复杂的操作逻辑,而是用最自然的方式表达需求。设备负责理解、执行和协同,人只需要负责做决定。

如果能够把这些能力真正落地,我觉得“人机交互”会从现在的功能竞争,逐渐变成理解能力、协作能力和服务能力的竞争。这也会让手机、PC、平板等产品不再只是工具,而是真正成为能够理解用户、辅助用户完成事情的智能伙伴。
天地玄清  LV4  发表于 6 天前 北京 来自:OPD2401
我想提出一个”情境自适应交互”的方案:让设备根据用户当下的姿态、环境和任务,自动在触控、语音、隔空手势之间切换,而不是让用户去适应设备。

具体分三个场景:

1. 办公协同场景——”注意力即焦点”
手机、平板、PC 同账号在线时,用 UWB + 摄像头判断用户视线落在哪块屏幕上,那块设备自动成为”主控端”。比如我正在电脑上写文档,拿起手机看消息,手机上复制的内容可以直接”甩”到电脑光标位置——不需要任何配对或拖拽,设备知道我要跨屏。技术上 UWB 测距 + 端侧视觉姿态识别已经成熟,荣耀的多设备互联协议也能承载。

2. 运动/骑行场景——”零触控语音闭环”
骑车或跑步时,手不能离开车把、汗手也摸不准屏幕。方案是:设备通过加速度计判断用户处于运动状态后,自动锁死触控、切换为”语音 + 耳机按键”双通道,并且语音指令做轻量化——不需要唤醒词,直接说”导航回家””回拨刚才那个电话”,因为运动场景下指令集有限,端侧小模型完全能做到高识别率。配合骨传导耳机,环境音也不影响。

3. 折叠屏/AR 新形态——”空间手势替代层级菜单”
折叠屏展开后,很多操作还停留在手机的”点按返回”逻辑里。可以加入:握拳 = 返回,手掌左右推 = 切换分屏应用,双指捏合 = 收起悬浮窗。这些手势用前置 ToF 或超广角摄像头就能捕捉,不需要额外硬件。AR 眼镜时代这个逻辑可以直接复用,交互习惯不浪费。

底层逻辑: 所有交互方式不是并列可选,而是由一个”情境引擎”统一调度——传感器输入 → 端侧模型判断场景 → 自动激活对应交互通道。用户永远用当下最自然的方式操作,设备负责”读懂我现在该怎么被用”。这比单纯加一个语音助手或一种新手势更有价值,因为它解决的是”多场景下交互方式碎片化”这个根本问题
周伯通  LV7  发表于 6 天前 黑龙江 来自:荣耀Magic7 RSR 保时捷设计
人机交互创意与解决方案

随着移动设备形态不断丰富,手机、平板、PC、车机、折叠屏、AR/VR眼镜等多终端协同普及,办公、健康、游戏、骑行等细分场景愈发复杂,传统单纯的触控、语音交互存在局限。结合多设备协同、多元化硬件形态与复杂使用场景,打造更高效、自然、便捷的全新人机交互方案。

在多设备协同互联场景,打破设备壁垒,实现跨终端无感交互。当手机、平板、车机、第二屏幕同时在线时,支持跨设备手势流转。例如手机上浏览文档,隔空手势即可将页面、图片拖拽流转到平板、PC;在车机场景,无需手动操作,通过简单手势完成切换导航、调节音量。同时优化语音跨设备联动,语音指令可自动识别当前使用设备,不用手动指定设备,实现多终端统一语音控制,解决多设备切换操作繁琐的痛点。

针对折叠屏、AR/VR等新型硬件形态,优化适配交互逻辑。折叠屏设备区分大屏、小屏两种形态,自动适配交互模式:小屏状态沿用传统触控;展开大屏后,支持多指手势、分屏快捷操作,滑动手势快速拆分窗口,提升办公效率。对于AR眼镜,优化非接触式交互,结合眼动追踪+手势识别,不用手持设备,通过眼球注视搭配简单手势完成点击、滑动,适配沉浸式体验;同时降低误触,区分无意眨眼与操作指令,提升识别准确度。

面向办公、健康、游戏、骑行等细分场景,打造场景化智能交互。办公场景,支持语音+手势混合交互,开会时,语音记录会议要点,隔空手势快速翻页、标记重点,解放双手。健康场景,结合穿戴设备,语音可快速查询心率、睡眠数据,抬手手势即可调取健康报告。游戏场景,针对大屏、VR设备,支持体感手势交互,替代部分按键操作,增强游戏沉浸感。骑行场景,户外双手握持车把,减少手动操作,通过简短语音指令、头部微动手势,实现接消息、切换音乐,兼顾安全性。

同时优化交互容错能力,提升体验友好度。语音交互增加场景语义理解,识别嘈杂环境下的指令,区分环境杂音和人声;手势交互可以学习用户个人操作习惯,降低误识别。建立统一交互逻辑,无论手机、折叠屏还是AR设备,手势、语音指令保持一致性,减少用户学习成本。

通过手势、语音、眼动多模态融合交互,适配多样化硬件与复杂生活场景,实现更加自然高效的人机交互,满足用户多终端、多场景下的使用需求。
数码爱好者  LV8  发表于 5 天前 江苏 来自:荣耀Magic7 Pro
建议在NPU部署语音语义编译器,精简控制指令链路,降低YOYO响应时延

痛点

目前YOYO设备控制类指令完整流程:
DSP采集音频→NPU做语音识别输出文本→文本传给CPU,送入大模型服务→生成自然语言文本回复→再提取控制意图→调用系统API。
中间多次传输完整文本字符串,产生数据拷贝与解析开销,造成语音控制指令存在可感知延迟。

功能构想

利用NPU算力,部署语音语义编译器模块,专门处理设备控制类语音指令:

1. DSP完成收音、降噪、唤醒之后,音频特征送入NPU;

2. NPU内部完成ASR识别+语义编译,直接输出系统可识别的轻量结构化控制指令包,不再输出完整自然语言文本;

3. 将精简指令包交付给CPU;CPU完成权限校验,直接调用系统API执行操作;

4. 闲聊、问答类场景不进入该加速通路,保留原有对话逻辑。

注:不会生成CPU裸机器码,所有操作依然经过系统权限沙盒校验,保障系统安全。

容错兜底机制

当语音识别置信度不足、用户指令模糊,语义编译器自动降级,退回原有对话流程,向用户确认意图,避免误操作。

方案优势

1. 把意图解析编译工作放在NPU侧,减少NPU与CPU之间大段文本的传输、序列化开销;

2. 裁剪冗余中间环节,缩短语音设备指令的响应时间,提升交互跟手度;

3. 复用现有硬件DSP‑NPU‑CPU架构,无需新增硬件;

4. 区分“设备控制指令”和“闲聊对话”两条路径,互不干扰。
数码爱好者  LV8  发表于 前天 15:36 江苏 来自:荣耀Magic7 Pro
【创意提案】优化AI随心握,采用分段天线+人脸注视双重校验,提升识别稳定性

痛点简述
当前AI随心握依靠屏幕边缘触控识别用户握持方式,存在明显短板:

1. 佩戴厚手机壳,或者手指仅捏住中框、没有触碰屏幕玻璃时,识别容易丢失,来电横幅接听/挂断按钮来回抖动,体验断续。
2. 手机倚靠枕头、金属物体压住边框时,存在误识别风险。
3. 仅依靠触控单点判断,识别可靠性还有提升空间。

优化方案构想

本方案仅面向竖屏单手握持来电横幅场景,横屏场景不启用该功能,减少复杂边界问题。
采用「边框多段天线轮廓识别 + 前置人脸注视检测」双重校验机制。

1. 硬件原理:在手机边框布置多段独立天线单元。当手指握持边框,不同分段天线会产生信号衰减,系统采集每一段天线状态,生成边框遮挡轮廓。
- 人手握持特征:手指遮挡是间断、镂空式的分段遮挡;
- 枕头、金属外物遮挡:大多是大面积连续整块遮挡。
AI根据遮挡轮廓形态,初步区分是人手握持还是外物挤压遮挡。
2. 双重校验规则(必须两项同时满足,才触发按键自适应)
① 分段天线识别判定为竖屏单手握持;
② 前置摄像头端侧AI检测到人脸正在注视屏幕。
只有用户单手拿着手机,同时正在注视屏幕,才自动将接听、挂断按钮移动到拇指一侧。
即使外物压住边框,天线检测到遮挡,但没有检测到人脸注视屏幕,则不触发UI调整,杜绝误识别。


方案优势

1. 识别精度更高:不再依赖屏幕触控,佩戴厚壳、仅捏住中框也能稳定识别,解决弹窗按键来回抖动的问题。
2. 误识别大幅降低:遮挡轮廓AI识别+人脸注视双重校验,双重兜底,减少枕头、金属物品带来的误触发。
3. 边界简单可控:仅支持竖屏单手场景,不兼容横屏,规避横握、前置镜头遮挡等大量复杂问题,降低工程落地难度。

数码爱好者  LV8  发表于 前天 15:39 江苏 来自:荣耀Magic7 Pro
深化YOYO建议“智慧文件夹”推理能力的建议——从“行为预测”升级为“意图侦探”

核心建议:赋予YOYO“侦探式”的推理能力

我建议,能否在现有行为预测的基础上,为YOYO建议引入一套全新的推理引擎,让它从一个“记录员”升级为一位能读懂你心思的 “侦探” 。这意味着YOYO不再是简单地根据“这个时间点你经常做什么”来预测,而是通过整合多维度的碎片化信息,动态推理出“你最近在忙什么”,从而主动提供你最需要的服务。

这一设想基于荣耀AI已经具备的技术底座,例如端侧的个人知识库学习能力、MagicGUI多模态感知以及自进化AI 。具体功能建议如下:

1. 引入“短期深度记忆”与“长期兴趣图谱”双维度推理

- 当前困境:目前的预测主要依赖长期的行为规律,当用户的兴趣或任务发生临时变化时,系统反应滞后。
- 改进方案:
1)短期深度记忆(侦探的“案件档案”):让YOYO在获取用户授权的前提下,具备对近期行为的深度感知能力。例如,它能够“读取”你最近三天在购物App的搜索记录(如“露营装备”)、在备忘录里记录的行程要点、以及在浏览器中搜索的目的地攻略。

2)长期兴趣图谱(侦探的“罪犯侧写”):结合你长期稳定的兴趣,如“摄影”、“财经”、“美食”,构建个人兴趣标签。

- 应用场景:
案例A(旅行规划):当你周末在多个App里搜索“杭州攻略”、在浏览器查看“西湖民宿”,并与朋友在微信讨论“周末去杭州穿什么”后,YOYO建议的智慧文件夹无需你主动操作,便动态生成一个“杭州出行文件夹”。里面不仅包含你常用的地图、打车软件,还智能推算出你可能需要的“杭州地铁图”小程序、“大众点评必吃榜”卡片,甚至是YOYO主动询问是否需要创建“行李清单”代办事项。

案例B(项目攻坚):当你的聊天记录中频繁出现“PPT”、“Q4汇报”等关键词,且下班后多次打开WPS时,YOYO建议将你的办公文件夹置顶,并智能推荐“录音转文字”、“思维导图”等你可能需要的生产力工具,甚至在你进入会议室时,自动建议开启“会议录音”和“文档协同”入口。

2. 从“单点App推荐”升级为“场景化服务集群”

- 当前困境:目前文件夹推荐的是单个App,但完成一项任务往往需要多个App接力。
- 改进方案:
意图理解与任务编排:YOYO应像一个侦探理解了案情全貌后,直接给出行动方案。它不只是推荐“美团”,而是通过分析你的聊天记录(“晚上老地方聚”)和购买记录(刚买了电影票),推理出“今晚有朋友聚餐+看电影”的计划。此时,智慧文件夹直接变成一个名为“今晚聚会”的服务卡片,里面集成了“被约餐厅的导航”、“电影票取票码”、“拼车回家”三个快捷服务,点击即可直达,无需再一个个打开App查找。

跨应用信息协同:当你准备打车去一个刚在微信里收到的地址时,YOYO建议自动弹出“一键打车至[微信分享的地址]”的选项。这背后正是YOYO理解了对话中的地址信息,并将其与打车服务进行了串联。

3. 动态的、会进化的“文件夹自我迭代”

- 当前困境:用户需要手动设置和调整文件夹。
- 改进方案:
“侦探”的自主学习:如果YOYO根据聊天记录推理出你可能需要“露营”,并生成了露营相关服务文件夹,但你实际上并未使用,它会像侦探发现新线索一样,迅速调整推理逻辑,避免下次再犯。这种基于反馈的动态推理能力,正是荣耀“自进化”AI的体现。

隐私安全的“线索本”:所有推理过程均在端侧完成,确保个人数据隐私。用户应拥有完全的透明度与控制权,可以随时查看YOYO的“推理线索”(即“你为什么给我推荐这个?”),并有权关闭任何不想被“读取”的数据源。

三、建议的价值

1. 真正的“懂你”:从被动响应到主动服务,让用户感受到手机不仅是工具,更是一位了解自己的智能伙伴。
2. 效率的极大提升:将用户原本需要在多个App间跳转、搜索、复制的操作,简化为一步直达,真正实现“想你所想,及你所及”。
3. 强化MagicOS的差异化体验:这种深度的、基于端侧大模型的意图推理能力,将成为荣耀区别于其他品牌的核心竞争力,将“越用越懂你”的体验推向新的高度。

 

注:上面是可直接复制提交到星火共创研发部的纯正文,已经剔除论坛楼层、头像、官方回复等无关内容。
如果你需要,我还可以帮你做精简压缩版本,适配共创平台字数限制。
广西第一深情  LV9  发表于 昨天 00:53 广西 来自:荣耀Magic8

一、触控交互优化,适配多设备、多形态产品
1. 自适应握姿触控识别(手机/折叠屏)
日常拿手机姿势五花八门,单手、横握打游戏、双手捧折叠屏都不一样。系统通过握持位置自动调整触控热区:单手操作时屏幕远侧区域降低误触概率,放大拇指容易碰到的区域灵敏度;折叠屏展开后区分左右半屏触控逻辑,左手、右手操作分别适配,避免误点。平板大屏模式下支持局部精准小触控,做表格批注的时候,手指粗大也不容易点错单元格。
2. 跨设备手势联动触控
一套简单手势可以跨设备执行指令:比如手机双指捏合,就能把当前文档投送到平板或者电脑;三指下滑,手机内容流转到车机。不用先打开控制中心一步步点流转,手势一步到位,办公传输效率更高。
3. 场景化快捷触控
骑行、手上沾水、戴薄手套的时候普通触控经常失灵。可以增加低灵敏度模式,开启后触控识别门槛放宽,戴普通劳保手套也能滑动屏幕;骑行模式屏蔽误触,颠簸状态下不会因为抖动误切页面。

二、语音交互升级,解决现有痛点
1. 分场景免唤醒短句语音,解放双手
办公手上拿纸笔记录、做饭、开车的时候,每次都喊唤醒词很麻烦。可以设置场景内短时免唤醒:例如连接车机后,直接说“导航回家”“调高空调”;办公投屏状态,直接说“下一页”,不用每次先喊唤醒词。同时增加上下文记忆,连续下达指令不用重复唤醒,比如先说“打开表格”,接着直接说“放大第一列”。
2. 降噪+区分说话人,多人环境精准识别
办公室会议室人多嘈杂,现在语音助手经常把旁边同事聊天内容当成指令。方案:AI识别声源方向,只拾取正对设备使用者的人声,过滤周边杂音;多人开会时还可以区分不同说话人,语音转文字时自动标注发言人,做会议纪要非常实用。
3. 语音可控精细度提升,不止只能打开APP
不只是“打开微信”这种简单指令,支持精细操作。例如语音说“把这段文字复制,发送到电脑端”“表格A列加宽两格”,直接完成跨设备操作;语音可以控制折叠屏分屏,说一句“左边文档,右边浏览器”自动分屏,不用手去点。

三、多设备协同交互
1. 交互状态自动跟随人切换
手机拿在手上,交互以触控为主;坐到办公桌前手机靠近电脑,自动切换键鼠级交互逻辑;上车靠近车机,自动切换语音优先模式;佩戴AR眼镜时,结合语音+空中微手势操作。设备自动判断当前场景,不用用户手动切换交互模式。
2. 交互指令跨设备接力
手机上语音说了一半被打断,坐到平板前面,可以接着刚才的指令继续操作。比如出门前手机语音说“写一份会议提纲”,到公司坐到平板旁,平板直接接续这个任务继续编辑,指令不会因为换设备中断。

四、特殊细分场景交互优化
1. 办公场景:长时间用电脑,手机收到消息不想停下手里工作,可以语音回复消息;平板批注文档时,触控搭配简易语音指令,语音说“红色批注”,手指直接写,不用反复点开颜色工具栏。
2. 骑行场景:尽量减少触控,全部交给语音,仅保留极少必要的安全手势,防止骑车低头点屏幕带来危险。

五、隐私与人性化补充
1. 免唤醒语音不能全天候生效,由用户手动开启场景模式,避免无意间说话误触发设备,保护隐私;
2. 全部交互方式都提供开关,有些用户不习惯手势或者语音,可以关掉,回归传统纯触控,给用户选择权,不强制使用新交互。
数码爱好者  LV8  发表于 5 小时前 江苏 来自:荣耀Magic7 Pro
YOYOClaw多专精模型协同调度框架,集合多家AI专长提升问答质量

一、当前痛点

现在手机AI助手大多调用单一的大模型。每个大模型都有自己的长处和短板:有的擅长写文案,有的擅长逻辑推理、代码,有的擅长资料整理。

只用单一模型遇到复杂问题时,很容易出现推理不够深入、回答片面的情况。

如果直接同时调用多个完整大模型,会存在两个明显问题:

1. 不同模型的表达方式、理解习惯不一样,任务接力的时候容易理解偏差、丢失信息;

2. 多步串行任务,需要一步一步排队计算,叠加等待时间,响应变慢。

二、优化方案:YOYOClaw总调度框架

建议荣耀搭建一套YOYOClaw智能调度中心,联合豆包、通义千问、DeepSeek等AI厂商。

各家不用提供完整大模型,而是提供轻量化的专精小模型,每个专精模型只负责自己最擅长的一类任务(比如逻辑拆解、代码编写、文案润色、文本摘要),不做全能对话。

由YOYOClaw统一分配任务,两种工作模式:

1. 串行接力模式(有前后关联的复杂任务)

把复杂问题拆成连续步骤,交给对应的专精模型依次接力处理。

举个例子:用户要求“先拆解问题逻辑,再写创意文案,最后精简润色”。先由逻辑模型处理,产出中间结果,再交给文案模型继续加工。

2. 并行处理模式(多个互不相关子任务)

一个问题拆成多个独立小任务,多个专精模型同时开工。

例如一边检索资料,一边生成表格,全部完成之后再汇总结果。

配套优化1:增加统一语义适配层,解决模型“语言不通”

在调度框架内增加语义转换适配器。

不同专精模型输出的内容,都会转换成一套标准化的中间信息,再传给下一个模型。

这样不同厂商的子模型之间可以顺畅理解上一步的结果,减少接力过程里信息丢失、理解跑偏的问题,实现语义互通。

配套优化2:预判预热机制,降低串行任务的等待延迟

在串行接力的过程中,YOYOClaw会实时读取上一个模型逐步输出的内容,预判接下来要执行什么任务。

当预判的可信度足够高时,提前为下一个接力模型加载资源、预热需要用到的计算算子,提前完成可以预判的计算。

安全保护:如果预判把握不高,则不执行预热,避免空跑计算,浪费手机算力和电量。

最后统一校验汇总

所有子任务完成后,YOYOClaw整合全部结果,检查内容是否存在矛盾、统一排版风格,确认无误后,再把最终答案推送给用户。

三、配套控制选项(保障基础体验,降低风险)

1. 该多模型协同功能为可选高级功能,默认关闭。用户开启后才启用,日常使用依旧保持原来YOYO的单模型快速响应,不增加普通问答延迟。

2. 隐私管控:涉及用户隐私、敏感信息的提问,优先使用荣耀端侧模型处理,不会分发到第三方专精模型。

3. 故障降级:如果某一个专精模型调用超时或者失败,系统自动切换备用方案,不会直接中断回答。

四、预期收益

1. 取长补短,集合各家AI的强项。复杂问题的回答深度、准确度更高,弥补单一模型能力短板。

2. 轻量化专精模型,相比调用完整大模型,算力开销更低。搭配预热机制,缓解串行任务带来的等待延迟。

3. 统一语义适配,解决不同AI模型接力时理解错位的问题,答案逻辑连贯。

4. 不替换现有YOYO基础能力,作为附加增强功能,新旧方案互不冲突
您需要登录后才可以评论 登录 | 立即注册
简体中文 - China
快速回复 返回顶部 返回列表