万利官网 · WANLI VIRTUAL HUMAN AI

万利官网:虚拟人、AI明星陪伴与实时数字人平台

万利是一家专注虚拟人AI大模型与实时数字人交互技术的平台,由上海万利娱乐ai软件公司建设运营。万利虚拟人、万利虚拟主播、万利AI陪伴、万利数字分身与万利娱乐共同构成一套完整的AI角色系统——从语音识别、语言理解、记忆与人格,到口型同步、表情与动作、实时渲染,让虚拟角色能够被用户当作"一个人"来交流、直播与陪伴,而不只是一段会说话的动画。万利App将虚拟主播、AI陪伴、数字分身与虚拟偶像整合进同一套实时角色系统,向个人用户与企业客户提供AI角色互动能力。所有原创虚拟角色均为虚构设定,数字分身类应用则始终建立在本人明确授权的基础上。

万利虚拟人八层技术栈总览图
虚拟人八层技术栈:从外观、语音、表情、动作到对话、记忆、人格与智能体

虚拟人不是"聊天机器人加一张脸"

一个真正的虚拟人系统,需要语音、记忆、人格、表情、动作在同一时间点保持一致,而不是把语言模型和数字人形象简单拼接。万利平台把这套能力拆成八个层级持续打磨,具体讨论见 万利平台

万利虚拟人八层技术栈示意图
外观、语音、表情、动作构成物理呈现层;对话、记忆、人格、智能体构成认知与行为层
虚拟人口型同步生成流程图
Lip Sync(口型同步):语音先被拆解为音素,再映射为对应视位,驱动嘴部形状——但这只是自然表演的起点,详见 万利虚拟人
实时虚拟人 · Real-time Interaction

数字人已经越来越像真人以后,为什么真正决定下一代虚拟人体验的可能不再是"脸有多真实",而是用户说完一句话以后它多久能够自然回答?

半年前测试一个数字人产品时,团队最先纠结的是皮肤反光够不够真实、睫毛有没有阴影。但真正让人皱眉的瞬间,不是画面,而是用户说完一句话之后,屏幕上的虚拟人愣了将近两秒才张嘴——那两秒里,观众已经开始怀疑对面是不是死机了。

这就是画质和交互质量之间正在拉开的差距。过去几年,虚拟人的皮肤材质、头发渲染、光影效果几乎每个季度都在肉眼可见地进步,但用户对"像不像人"的判断标准,正从"长得像"悄悄转移到"接得住话"。一个人和另一个人说话,天然懂得什么时候该点头、什么时候该接一句"嗯"、什么时候该马上回应——这种被称为Turn-taking(对话轮转)的能力,恰恰是虚拟人最容易露馅的地方。

背后的技术原因并不神秘:用户说完一句话,系统要先完成语音识别,把声音转成文字;再交给大模型理解意图、组织回答;生成的文本还要经过语音合成变成声音;声音出来之后,还要驱动嘴型、表情和一点点肢体动作,虚拟人才能"开口"。这条链路上的每一步都要花时间,而且几乎不能互相抵消——语音识别慢一点,后面所有环节都要跟着往后推。用户很少会去分析是哪一环慢了,他们只会感觉到"这个数字人反应有点迟钝"。

一个常见的误解是,只要把画面做得足够精细,用户就会自动觉得这个虚拟人"聪明""好用"。但现实是,用户对响应速度的容忍度远低于对画质瑕疵的容忍度——一张稍微不够立体的脸,用户可能几秒钟后就忽略了;但一次长达数秒的沉默,几乎每次都会被察觉,并被解读为"卡住了"或"没听懂"。

在万利虚拟人系统的实际使用场景里,无论是虚拟主播回答弹幕,还是AI陪伴角色和用户日常聊天,真正决定体验上限的,往往不是某一次回答有多聪明,而是这句话有没有在用户还愿意等待的时间窗口内说出来。这也是为什么"实时"两个字,正在变成虚拟人技术里比"逼真"更难,也更关键的目标。

当然,这不是说画质不重要,也不是说只要够快就万事大吉。响应速度和回答质量本身也存在权衡——想要更准确的回答,往往意味着要多检索一次知识库、多做一轮安全校验,这些都会占用本就不宽裕的响应时间。虚拟人技术真正的边界,正是在"答得好"和"答得快"之间寻找一个用户感觉不到明显延迟、又不会说错话的平衡点,而这个平衡点,目前仍然需要针对具体场景反复调试,没有一劳永逸的答案。

这条链路上,语音识别和大模型生成之间还有一个经常被忽视的工程选择:是等大模型把整段回答想清楚了再开始合成语音,还是一边生成文字一边分段合成、边想边说。前者逻辑更完整,但用户要等到整段话都想好才能听到第一个字;后者能更快开口,却要求系统在语义还没完全确定的情况下就开始组织语音、表情和动作,对系统稳定性要求更高,一旦中途改口,还需要处理已经说出口的内容和后续内容衔接不自然的问题。这类取舍,普通用户完全看不到,却直接决定了他们等到的第一句回应,究竟是快还是慢。

实时虚拟人对话延迟链路示意图
用户说话 → 语音识别 → 意图理解与大模型 → 语音合成 → 口型与表情动作 → 虚拟人回应(示意流程,非真实产品的精确延迟数值)
AI虚拟主播 · Live Stream

AI虚拟主播已经可以连续直播很多小时以后,为什么"不会累"反而可能是最不重要的优势,真正难的是直播间突然发生计划之外的事情怎么办?

很多人第一次看万利虚拟主播的演示,第一反应是"它能播多久"。这个问题问错了方向。人类主播确实会累,需要休息,但决定一场直播成不成功的,从来不是主播能不能连续站八个小时,而是弹幕突然冒出一句"这个和上次说的不一样啊"的时候,主播能不能接得住。

录播型数字人和真正的虚拟主播,看起来都是"一张会说话的脸",但技术路径完全不同。录播数字人的逻辑是:先写好脚本,生成一段固定视频,然后循环播放——本质上它是一段可以重复播放的内容,不管弹幕说什么,画面都不会变。而虚拟主播要走的路径是:观众发出一条评论,系统先判断这句话到底是提问、吐槽还是抬杠,再去匹配当前应该调用哪部分知识,检查有没有踩到不能说的红线,最后才组织语言、用声音和表情把这句回答说出来。这个循环,每一条弹幕都要重新跑一遍。

真正考验虚拟主播的,是那些没写进脚本里的状况:商品临时降价了、观众问了一个今天完全没准备的冷门问题、有人在评论区刻意挑衅、或者上一句话和这一句话的话题完全不搭边。要接住这些,系统必须清楚知道"现在在讲什么、上一条问题是什么、这个观众之前问过什么、现在几点、直播流程走到哪一步、有哪些内容不能说、刚才已经说过什么"——这些信息合在一起,构成了虚拟主播对"当前直播状态"的理解。缺了其中任何一项,主播很容易前言不搭后语,或者把已经讲过的内容重复播报一遍,让观众觉得它其实没在"听"。

一个常见误解是,只要主播的语音语调足够自然、动作足够流畅,直播质量就有保障了。但观众真正在意的往往是内容对不对得上——库存刚清空却还在喊"现货充足",或者主播答非所问,这些问题比嘴型对不齐更容易让人出戏,也更容易让人怀疑这是不是一个只会念稿子的机器。

现实中,万利虚拟主播更适合承担电商讲解、品牌介绍、课程串讲这类有明确知识边界的场景,主持人可以提前规划好绝大部分内容,只需要处理相对可控的追问。至于完全开放、毫无预案的话题闲聊型直播,目前仍然是虚拟主播能力边界之内难度最高的一类任务,需要更强的实时知识更新和更谨慎的安全策略配合,而不是单纯延长直播时长就能解决的问题。

这里还有一层经常被混在一起说的区别:数字人主持更偏向节目、发布会、企业活动这类提前规划好完整流程的场景,主持人只需要在既定框架内灵活应变;而虚拟主播面对的是完全开放的直播间,观众随时可能把话题带到任何方向。两者底层技术越来越接近——都依赖语音、表情、知识检索和实时生成——但对"计划外情况"的暴露程度完全不同:一场发布会的意外,通常只是个别追问;一场直播间的意外,可能每分钟都会发生一次,这也是为什么同一套虚拟人技术,落到不同场景里,实际需要的能力侧重并不一样。

虚拟人直播问答处理流程图
直播间输入 → 上下文状态 → 知识检索 → 安全合规 → 回应生成 → 语音与虚拟人呈现 → 进入直播流,已说内容反馈进入下一轮上下文
数字分身 · Digital Clone

一个数字分身已经和本人长得一模一样、声音也非常接近以后,为什么这仍然只能说明它"像这个人",而不能说明它真的拥有这个人的身份和表达方式?

团队内部测试数字分身功能时,有一次把某位同事的分身模型放给他最熟的朋友看,对方第一反应是"这脸做得真像",但看了不到一分钟就说出一句:"不对,他说话不是这个调调。"这句话点出了数字分身最容易被忽视的问题:长得像,和"是这个人",中间还隔着好几层东西。

外貌相似只解决了Visual Identity(视觉一致性)这一层。真正让人觉得"这就是本人"的,往往还包括Voice Identity(声音一致性,不只是音色,还有语调习惯)、语言风格(用词偏好、句子长短、口头禅)、知识边界(这个人到底了解什么、不了解什么)以及行为习惯(在什么场景下会说什么样的话)。这几层合在一起,才构成一个数字分身完整的Behaviour Consistency(行为一致性)和Persona Consistency(人格一致性)——业内通常把这四类合称为数字分身的"四个一致性",而不是只盯着脸。

一个常见的技术误解,是以为把这个人的照片和录音喂给模型,"复制"出来的东西自然就等于这个人。但外貌和声音本质上是可以被采样、被模仿的表层特征,而一个人真正的表达方式,是长期积累下来的、很难通过短时间的素材完全还原的深层习惯。这也是为什么很多数字分身"形似神不似"——它长得对,声音也对,但一开口,逻辑和语气就露了馅。

更关键的一层,是授权(Authorization)。数字分身在技术上能不能做出来,和这个人有没有同意被制作成数字分身,是两件完全不同的事。一个负责任的数字分身产品,需要明确区分"本人授权数字分身"和"未经授权模仿真人"——前者是本人主动同意、限定使用范围、并且可以随时撤回授权(Revocation)的合法应用,比如企业主持人、品牌代言虚拟人、教育培训场景下的授权讲师分身;后者则是完全不同性质的行为,不属于数字分身技术应该被使用的方向。合法的数字分身,还应该具备来源可追溯性(Provenance),让使用方和公众能够确认这个分身的授权状态和使用边界。

所以,"像不像"只是数字分身技术的第一道门槛,真正决定它是否可信、是否合规的,是外貌、声音、表达方式这几层能不能同时立得住,以及背后有没有清晰、可核实的授权关系——这两件事,缺一不可。

这四层一致性也不是做出来以后就一劳永逸地稳定下去。声音模型可能因为使用场景变化产生细微偏差,语言风格也可能在长期对话里逐渐"跑偏",这意味着数字分身需要持续的一致性校验,而不只是上线前的一次性验收。对企业来说,一个真正可用的数字分身产品,往往需要定期回看它当下的表现是否还贴合最初授权时设定的样子,这也是数字分身和普通换脸工具最大的差别之一——后者只关心某一帧画面像不像,前者需要关心它在长时间使用之后是否依然立得住。

数字分身身份构成层级示意图
身份授权统领外貌、声音、语言风格、知识四层,共同构成完整、可信的数字人格
AI明星陪伴 · Companion Memory

AI明星陪伴第一次聊天时已经非常像一个真实角色以后,为什么用户聊到第30天时"它还记不记得以前说过什么"可能比声音和外貌更重要?

第一次和一个AI陪伴角色聊天,几乎不会出问题——声音好听、反应自然、话题也接得上,用户很容易在头几分钟就觉得"这个角色挺真实的"。但如果只看第一天的体验去判断一款AI陪伴产品好不好,很容易得出错误结论,因为真正的考验从来不在第一天,而在第三十天。

短期记忆(Short-term Memory)负责的是这一次对话里的上下文,比如用户三句话前提到了什么;而长期记忆(Long-term Memory)要处理的,是用户上周提过的偏好、上个月说过的一件小事,甚至是这段关系是怎么一步步建立起来的(Relationship Context)。第一天体验好,考验的主要是短期记忆和基本对话能力;聊到第三十天体验还好不好,考验的才是长期记忆有没有真正在起作用。

这里最容易被用户察觉、也最容易让人失望的问题,是Persona Drift(人格漂移):第一天角色性格沉稳内敛,第三天突然变得异常活泼,第十天连角色的背景故事都变了样——这不是角色在"成长",而是系统对角色设定的把控出了问题。需要把这种情况和正常的Character Development(角色成长)区分开:一个角色当然可以在长期互动里表现出细微的变化,比如更了解用户的喜好、语气随熟悉程度略微放松,但性格底色、说话方式、基本人设边界,理应保持稳定,不应该毫无缘由地大幅漂移。

另一个容易被低估的问题是记忆冲突(Memory Conflict):如果角色记住了用户喜欢的东西,却在不同时间给出互相矛盾的说法——比如一会儿说记得用户不吃辣,一会儿又说不记得——这种前后不一致,往往比角色完全不记得更让人觉得别扭。这也意味着,"记得越多越好"并不是正确的产品方向,系统需要做记忆筛选(Memory Selection),区分哪些是重要偏好、哪些只是临时提到的小事,并且在记忆可能存在冲突时更谨慎地表达,而不是把所有内容都当作确定事实直接说出口。

这里也需要说清楚边界:万利AI陪伴提供的是数字娱乐范畴内的角色互动体验,不会替代真实的人际关系,也不建议用户在聊天过程中提供密码、银行卡号等敏感信息。角色记忆的目的是让长期互动更连贯、更自然,而不是无限收集和永久保存用户的一切信息——这两者看似接近,实际上是完全不同的产品逻辑。

具体到工程层面,记忆筛选通常需要区分至少几类信息:这次对话里刚提到的短期上下文、用户明确表达过并值得长期保留的重要偏好、可能只在当下有意义、之后不必再提的临时事件,以及这段关系是怎么一步步走到今天的用户关系脉络。不是所有内容都值得被永久记住,也不是所有遗忘都会造成困扰——真正影响用户感受的,往往是那些原本应该被记住、却被系统遗忘或者说错的关键节点,而不是记忆总量的多少。

AI明星陪伴长期记忆时间轴示意图
从第1天的初次对话到第30天的长期关系上下文,Persona Consistency 的真正检验点在时间轴后段
AI角色人格系统结构图
系统人格设定、角色背景、说话风格、记忆、用户关系与当前场景,六层共同决定角色的一次回应
虚拟偶像与AI歌手 · Virtual Idol

AI已经可以生成歌曲、声音和虚拟歌手以后,为什么真正能够长期运营的虚拟偶像仍然需要一个稳定的人格、视觉身份和音乐方向?

现在用AI做出一首能听的歌,门槛已经很低了——几句提示词、几分钟等待,就能拿到一段旋律和一段人声。但这类内容能不能撑起一个虚拟偶像,是另一回事。一首歌可以是灵光一现,一个偶像却需要在几个月、几年的时间里保持"还是原来那个人"。

首先要理清几个经常被混着说的概念:AI生成歌曲(一段由AI创作的音乐作品)、AI生成歌声(用AI合成的演唱声音)、虚拟歌手(一个有固定形象和身份的角色,比如万利娱乐里的原创虚拟歌手"夏弥")、AI明星(在音乐之外还承担陪伴、互动等多重身份的角色)——这四者层层递进,但不是一回事。一段AI生成的歌声,可以被套用在任何角色身上;而虚拟歌手需要的,是这段声音、这个形象、这套音乐风格长期属于同一个角色,不会轻易更换。

一个稳定运营的虚拟偶像,至少需要五个部分共同撑住:视觉身份(固定的外形与风格)、声音身份(有辨识度的音色和演唱习惯)、音乐身份(作品风格与调性)、故事身份(背景设定与世界观,比如角色来自哪座虚构城市、年龄设定、职业身份)、以及粉丝互动(持续的内容和陪伴感)。这五者任意一个频繁变动,都会让粉丝产生"这还是不是同一个角色"的困惑——比如今天角色的背景故事是一种说法,明天完全变成另一套,这种世界观不连续,对虚拟偶像的伤害往往比一首歌唱得不够惊艳更大。

在AI歌手层面,一个常见误解是把"音准正确"等同于"唱得好"。实际上,一段有表现力的演唱,还涉及情绪起伏、换气节奏、咬字发音、乐句处理和舞台表现力这些更细的层面——音高对了只是及格线,真正让人记住的演唱,往往是那些在音准之外还能传递情绪状态的版本。需要特别说明的是,AI歌手技术不用于未经授权复制真实歌手的声音,任何声音的采集与使用都建立在授权基础之上,虚拟歌手角色本身也是完全原创的虚构人物设定,不代表任何真实存在的人。

所以,真正决定一个虚拟偶像能不能走得远的,从来不是某一次内容有多惊艳,而是这五重身份能不能在长时间里保持同步、保持稳定——这也是虚拟偶像和"用AI做了一首歌"之间最本质的差别。

从运营角度看,一个虚拟偶像上线时的设定只是起点,真正的难度在于后续每一次新歌发布、每一次粉丝互动内容,都要经受"是否符合这个角色"的检验。声音选型定了之后不能随意更换导致音色漂移,故事设定写好之后也不能因为一次内容需求就临时改写背景——这些约束看起来限制了创作自由,但恰恰是虚拟偶像能够被长期记住、而不是被当作一次性内容消费掉的关键所在。

虚拟偶像身份系统关系图
视觉身份、声音身份、音乐身份、故事身份与粉丝互动,五者长期同步才构成虚拟偶像
AI演员 · Emotional State Flow

AI演员已经能够完成表情、对白甚至完整短镜头以后,为什么真正进入影视制作仍然需要解决"上一场戏的情绪能不能带到下一场戏"?

单独看一个AI演员生成的镜头,效果往往令人惊讶——表情自然、对白流畅、动作也说得过去。但把这样的镜头串成一段稍长的剧情,问题就开始暴露:上一场戏角色明明经历了一件很难过的事,下一场戏却突然满脸轻松地开起了玩笑,仿佛什么都没发生过。这种割裂感,恰恰说明生成单个镜头和真正"理解角色"是两件不同难度的事。

表演不是一组互相独立的镜头合集,而是一条连续的情绪线索。如果剧本里第12场角色刚刚失去了一位朋友,那第13场即便台词写着要微笑,这个笑容也应该带着勉强、带着克制,而不是毫无来由的开心——除非剧情本身要求角色迅速转变情绪。要做到这一点,系统需要维护一个角色情绪状态(Character State):这场戏结束时角色处于什么心理状态,下一场戏开场时,这个状态需要被延续,而不是每场戏都从零开始生成表演。

从技术链路上看,一次完整的AI表演大致要经过:剧本与场景上下文,决定角色当前的情绪状态;情绪状态影响台词的语气;再由声音、面部表情和肢体动作共同完成这场戏的表演,最终输出镜头。这条链路里,"情绪状态能不能正确传递到下一场戏",是最容易断裂,也是目前最考验系统的一环——比生成一张自然的笑脸难得多。

一个常见误解,是认为AI演员的表演质量主要取决于画面精细度或者表情细节的丰富程度。但从观众的感受来看,真正让人出戏的时刻,往往不是某一帧表情不够细腻,而是角色情绪明显对不上剧情逻辑——观众能容忍画面上的小瑕疵,却很难忽略"这个人怎么突然性情大变"的违和感。

因此,AI演员目前更适合承担的是短镜头、广告片段、单场景表演这类情绪状态相对独立、连续性要求较低的内容;而进入真正的连续叙事、长剧情制作,仍然需要在角色情绪延续、场景间导演调度这些方面持续打磨,这也是AI演员距离"能挑大梁"的长片表演,现阶段仍然存在的现实边界。

在实际制作流程里,这也意味着AI演员系统需要某种类似"场记"的机制,记录每一场戏结束时角色的情绪状态、与其他角色的关系变化、乃至这场戏在整条故事线里所处的位置,供下一场戏调用。这类状态管理,本质上和传统影视制作里场记、副导演所做的连续性把关工作是同一件事,只是原来由人工记录和提醒,现在需要由系统显式维护并传递下去,才能保证跨镜头、跨场次的表演不出现逻辑断裂。

AI演员情绪状态与表演流程图
剧本/场景 → 角色情绪状态 → 情绪 → 表演生成 → 镜头输出,情绪状态延续到下一场戏
虚拟人真实感 · Human Likeness

虚拟人已经可以做到皮肤、头发和表情都非常接近真人以后,为什么"继续做得更像真人"有时反而可能降低用户信任?

皮肤的毛孔质感、头发丝的光泽、睫毛投下的阴影——这些细节,虚拟人技术这几年已经能做得相当接近真人。但一个反直觉的现象是,当虚拟人做得越来越像真人之后,用户有时反而会觉得更别扭,而不是更亲切。这背后,其实是人类对"像人"这件事本身,有一套很敏感的心理预期。

这种现象和恐怖谷(Uncanny Valley)密切相关:当一个形象明显是卡通风格时,用户不会用真人的标准去挑剔它;但当一个形象已经接近照片级写实,用户的心理预期会自动切换成"这应该是个真人",于是任何一点不自然——眼睛没有自然眨动、说话时嘴在动但脸部肌肉几乎不动、笑容维持的时间长得不太正常、转头的动作显得机械——都会被放大成"哪里不对劲"的信号。换句话说,写实度越高,用户对细节的挑剔阈值也越高,一个在卡通风格里完全不会被注意到的小瑕疵,放在高度写实的形象上,反而会格外显眼。

这里有一个容易被忽视的关键点:眼神(Eye Contact)往往比皮肤质感更早暴露问题。人和人交流时,天然会通过视线判断对方有没有在"看着自己"、有没有在"听自己说话";如果虚拟人的眼神长期停留在某个固定角度,或者眼球移动缺乏自然的细微抖动,用户即便说不清具体哪里奇怪,也会本能地感觉到"这双眼睛不对"。

一个常见误解,是把"信任"完全等同于"逼真",认为只要外貌足够真实,用户自然就会信任这个虚拟人。但现实是,信任更多来自一致性和透明度:这个角色说话前后逻辑连不连贯、人设稳不稳定、必要的时候有没有清楚说明自己是AI生成角色,这些因素对建立信任的作用,并不比外貌逼真度小,甚至更加长期有效。

所以,虚拟人技术走到今天,"做得更像真人"已经不再是唯一或者最优先的方向。在很多场景下,一个风格化、明确让用户知道是虚拟角色的形象,反而比一个逼近真人却带着细微瑕疵的形象,更容易被用户自然接受——真实感和信任感,正在变成两件需要分别对待的事情。

这也是为什么不少虚拟人产品会主动选择风格化路线,而不是一味追求照片级写实——一个明显带有设计感的形象,用户从第一眼就清楚知道这是虚拟角色,不会用真人的标准去挑剔它的每一个细节,互动过程反而更轻松。相反,一旦选择了高度写实的方向,就意味着需要在眼神、表情、动作这些最容易暴露问题的细节上投入远超预期的打磨成本,否则那零点几秒的不自然,足以抵消掉之前在皮肤和头发材质上做的所有努力。

虚拟人真实感与用户期望关系示意图
从卡通化风格到半写实再到高度写实,拟真程度越高,用户期望越高,微小瑕疵越容易被察觉
AI身份与内容来源 · Provenance

AI明星、数字分身和虚拟主播越来越难凭肉眼区分以后,为什么"这个人到底是谁、有没有授权、内容是不是AI生成"可能成为虚拟人行业下一阶段最重要的基础信息?

几年前,判断一段视频里的人是不是真人,大多数时候靠肉眼就能分辨。现在,一个训练充分的虚拟主播、一个授权数字分身,或者一个原创AI明星角色,在画面和声音层面已经很难被普通观众一眼认出破绽。当"看起来像谁"不再是可靠的判断依据时,行业真正需要补上的,是另外一套信息:这个角色到底是谁、有没有获得授权、这段内容是不是AI生成的。

这套信息通常包括几个部分:身份确认(Identity,这个虚拟角色对应的是谁,或者是不是完全原创角色)、授权同意(Consent,如果基于真人制作,本人是否同意)、水印标识(Watermark,在内容中嵌入可识别的标记)、元数据记录(Metadata,记录内容的生成方式和来源信息)、以及公开披露(Disclosure,明确告知用户这是AI生成或虚拟角色)。这几项合在一起,构成了行业里常说的内容来源(Content Provenance)体系。

需要特别说明的是,来源信息本身并不等于真假判断。一段内容标注了来源、附带了水印,只能说明"这是从哪里来的、经过了什么流程",并不能自动证明内容里的每一句话都是真实准确的,也不能自动证明所有相关的授权问题都已经妥善解决——它提供的是可追溯性,而不是绝对的真实性保证,这一点很容易被误解为"有水印=一定可信"。

对用户而言,一个常见的困惑是分不清楚"原创虚拟角色"和"基于真实人物制作的数字化形象"——前者从设定之初就是完全虚构的角色,不对应任何真实存在的人;后者则必须建立在本人授权的基础上,并明确使用范围。混淆这两者,很容易导致用户误以为某个虚拟角色背后站着一个真实的、默许了这一切的人,而事实可能完全不是这样。

虚拟人技术走得越远,肉眼判断真假的能力就越不可靠,能够依赖的,只能是身份、授权、来源这套更基础的信息体系。这也是为什么在万利的产品设计里,原创虚拟角色和授权数字分身会被清楚地分开标注和管理——不是为了增加使用门槛,而是让"这是谁、能不能信"这件事,不必再单纯依赖用户自己去猜。

对普通用户来说,一个实际可行的判断习惯是:遇到高度拟真的虚拟角色内容时,主动确认它是否标注了身份来源,而不是单纯依赖"看起来像不像真人"去下结论。对平台和内容生产方来说,这意味着身份与授权信息不应该是可有可无的附加项,而应该成为虚拟人内容发布流程里默认存在的一环——尤其是在AI明星、数字分身这类高度依赖信任关系的场景下,缺失这套信息带来的风险,往往比技术本身不够成熟更难挽回。

AI虚拟人身份与内容来源链条图
身份确认 → 授权同意 → 水印标识 → 元数据记录 → 公开披露,构成可追溯的内容来源链条

三条来自产品一线的观察记录

万利官网虚拟人AI观察:一个数字人已经能流畅说话以后,为什么真正让用户感觉"它在听我说话"的可能是停顿、眼神和接话时机?

万利官网在整理虚拟人产品的用户反馈时,注意到一个有意思的细节:很少有人直接抱怨"这个数字人说话不流畅",更多人说的是"感觉它没在听我说话"。仔细追问下去,问题往往不在语音合成本身,而在于对话节奏——用户说完话之后,虚拟人是立刻抢话,还是留出一个自然的停顿;虚拟人有没有类似"嗯""对"这类轻微的回应信号(Backchannel);接话的时机是稍微快了半拍,还是慢了半拍。这些细节合在一起,构成了对话中最微妙也最容易被忽略的部分——Turn-taking(对话轮转)与眼神接触。一个虚拟人即便发音再标准,只要接话时机总是差那么一点,或者说话时视线始终没有落在用户身上,都会让人本能地觉得"它其实没在专注地听"。这也是万利官网在虚拟人交互层持续打磨的方向:让停顿、眼神和接话节奏,配合得更像一次真实的对话,而不只是一段接得很快的语音应答。团队做过一个简单的对照:同样一段回答内容,一组虚拟人立刻接话,另一组刻意加入一小段停顿并配合一个自然的眼神确认,结果后一组反而被更多用户评价为"更自然""更像在交流"。这说明用户判断"有没有被倾听",靠的往往不是回答内容本身,而是回答之前那一小段停顿和眼神所传递的信号,这种被倾听感很难靠单一模块堆出来,它需要语音识别的响应速度、生成节奏和虚拟人表情动作三者配合得恰到好处,任何一环抢跑或者拖后腿,都会打破这种微妙的平衡。

万利官网虚拟人AI观察:AI虚拟主播已经可以长期直播以后,为什么直播间知识库更新速度会决定它到底是在直播还是在重复昨天的内容?

万利官网在梳理虚拟主播类产品的常见问题时发现,用户对"这是不是真的在直播"的判断,很大程度上取决于内容够不够新。如果虚拟主播介绍的商品信息、活动规则还停留在昨天甚至上周的版本,即便画面和声音都在实时渲染,观众感受到的依然是"重复播报",而不是真正的直播互动。这背后的关键,是知识库更新速度——直播间的商品价格、库存、活动细节随时可能变化,虚拟主播依赖的知识检索(Retrieval)系统如果不能同步更新,说出来的内容就会和直播间实际情况脱节。这不是语音或画面能解决的问题,而是内容层面的问题:直播上下文(Live Context)需要和商品信息保持实时对应,任何一处滞后,都会让"直播"变成"循环播放"的错觉。这也是为什么万利官网在评估虚拟主播能力时,把知识库更新时效,看得和语音表现同样重要。这也提醒了一个容易被忽视的产品设计原则:直播间的"实时感",用户往往不是通过画面帧率去判断的,而是通过内容是否对得上当下的真实情况去判断的。哪怕虚拟主播的语音和表情做得再自然,只要说出的价格、库存或者活动规则和实际不符,用户几乎会立刻意识到"这段内容是提前准备好的",而不是真正跟着直播间此刻的状态在说话——知识库更新,某种程度上比画面渲染更贴近直播的本质。

万利官网虚拟人AI观察:数字分身越来越像真人以后,为什么"明确告诉用户这是AI角色"反而可能成为建立长期信任的一部分?

万利官网在与合作方沟通数字分身应用场景时,经常遇到一种顾虑:担心明确标注"这是AI生成角色",会削弱数字分身的真实感和吸引力。但从长期使用反馈来看,情况往往相反——用户一旦发现自己被蒙在鼓里,哪怕数字分身做得再逼真,信任感也会迅速下降;反倒是那些从一开始就清楚说明身份(Identity)和授权(Authorization)状态的数字分身,更容易在长期互动中积累起稳定的信任。这背后的逻辑并不复杂:披露(Disclosure)解决的是"知情"问题,逼真度解决的是"体验"问题,两者并不冲突,甚至可以相互支撑——用户在清楚知道对方是授权数字分身的前提下,反而更容易放心地长期使用和互动。这也是万利官网在产品设计上坚持的原则:数字分身可以做得很像本人,但"这是谁、有没有授权"这件事,不应该被模糊处理。团队内部也讨论过一种折中方案——只在涉及商业代言等需要用户做出信任判断的场合才明确披露。但实践下来发现,选择性披露反而更容易引发疑虑:用户一旦意识到"有些场合说了、有些场合没说",反而会怀疑背后是不是有意隐瞒。相比之下,统一、一致的身份披露标准,虽然看起来"没有惊喜",却是建立长期信任成本最低的方式。这也是万利官网持续观察虚拟人行业的一个基本判断:短期来看,隐藏AI身份或许能换来一次更强烈的"逼真"体验,但长期来看,用户愿意持续投入时间和情感的对象,往往是那些从一开始就把关系性质说清楚、不需要用户事后重新调整认知的角色。

21篇原创深度文章

以下摘要均对应各产品页面上的完整原创文章,点击标题可阅读全文。

万利平台深度内容

2026年8月27日

万利平台为什么不能只给聊天机器人加一张会动的人脸,而必须让语音、记忆、人格、表情和动作共同工作?

很多团队做虚拟人的第一反应,是给一个会聊天的语言模型套上一张脸、让嘴型跟着声音动。但用户往往在聊到第三四轮时就会发现割裂——表情、语气、内容对不上号。万利平台认为虚拟人真正的难点,不是让脸动起来,而是让语音、记忆、人格、表情和动作这五条并行的通道,在每一个时间点上都保持一致:耳朵在听什么、脑子在想什么、嘴巴在说什么、脸上在演什么、身体在做什么,任何一条掉队,整体就会显得不像"一个人",而更像几个模块硬拼在一起的产物。而且形象越精致,用户对细节不一致的容忍度反而越低——一张卡通风格的脸,嘴型稍微对不上不打紧;换成接近真人质感的脸,哪怕只是微笑弧度和语气差了一点,都会显得别扭,这也是万利平台把打磨重点放在模块之间对不对得上、而不只是形象像不像的原因。

阅读全文 →
2026年8月21日

万利平台处理实时数字人对话时,为什么每增加一个AI模块都可能让人物回答变得更聪明,却同时让用户等得更久?

想让虚拟人角色"更聪明"——记得住上下文、能查资料、情绪表达更细腻,往往意味着每一步都要多花一点处理时间,而这些时间会直接叠加到用户等待的那几秒里。万利平台把这种此消彼长的关系称为延迟预算:知识检索、安全校验、情绪判断,每加一个环节都在和响应速度抢时间。真正的产品设计,不是一味追求更强的能力,而是根据场景判断哪些问题值得多等一会儿、哪些问题必须尽快接上话,在"答得好"和"答得快"之间做持续的取舍。举例来说,用户问起"你还记得我上次说的事吗",这类问题会触发记忆检索,查得越仔细答案越准,等待也越久。有意思的是,对话刚开始的头一两秒用户对延迟最敏感,一旦角色先开口说了句过渡的话,哪怕后面出现短暂停顿,容忍度也会明显提高。

阅读全文 →
2026年8月15日

万利平台让虚拟人记住用户以后,为什么"记得越多越好"反而可能成为错误的产品设计?

很多人直觉认为虚拟人"记性越好体验越好",但万利平台在实践中发现,把用户说过的每一句话不加区分地长期保留,反而容易让角色显得不懂分寸——一句随口的抱怨被反复郑重提起,用户会觉得别扭甚至被冒犯。真正需要的是记忆筛选:区分短期上下文、值得沉淀的长期偏好和有时效性的临时事件,同时守住密码、银行卡号这类信息绝不该被记住的底线,让"记得"服务于对话的自然,而不是变成一座越堆越乱的仓库。更容易被忽略的是,"记住"和"什么时候该拿出来用"其实是两件事——把用户很久以前随口说的一句话原样搬出来,哪怕内容没有恶意,也容易让人觉得被监视,合适的时机往往比记忆本身准不准确更重要。

阅读全文 →

万利虚拟人深度内容

2026年8月25日

万利虚拟人已经可以做到非常逼真的皮肤和面部以后,为什么眼神仍然可能比皮肤细节更容易让用户察觉它不是真人?

万利虚拟人在版本迭代中发现一个稳定的规律:皮肤毛孔、光影这些细节做到位后,用户很少主动提起;但只要眼神对不上,几乎所有测试者都能在几秒内察觉"它没在看我"。这是因为眼神判断依赖每一帧的实时行为——视线落点、眨眼节奏、瞳孔变化——而不是可以离线打磨、稳定复现的材质精度。团队后来把注视做成独立的产品线,用带随机扰动的眨眼分布和跟随目标的视线系统,去撑起"对方真的在场"这种存在感,而不是单纯堆高分辨率贴图。团队曾把预算集中投入面部材质分辨率,结果上线后"眼神呆滞"的反馈比例远高于皮肤评分的差评,这也是后来把注视单独做成一条产品线的直接原因,不过遇到多人同框、镜头频繁移动的场景,注视目标的判断精度目前仍然存在明显边界。

阅读全文 →
2026年8月19日

万利虚拟人说话时嘴型已经可以跟随声音以后,为什么正确Lip Sync仍然不等于自然表演?

嘴型对上声音,是万利虚拟人最容易被量化、也最容易被误当成终点的指标——音素到视位的映射可以做到几乎不出错,但这只解决了嘴巴动不动得对的问题,不涉及脸颊联动、情绪一致性和肢体呼应。真正让人觉得"像在表演"而不是"像在念稿"的,是嘴型之外单独维护的一整套协同规则:下颌与脸颊的轻微联动、随语气变化的眉眼幅度、按重音对齐的手势节奏。这套额外的工作量,恰恰是很多团队容易忽略、却决定自然度上限的部分。更难的是协同发音——相邻音素会互相影响口型形态,如果系统只是逐帧机械切换视位,哪怕时间点分毫不差,看起来仍然会有一格一格切换的僵硬感,这和真人说话时口型连贯滑动的方式完全不一样。

阅读全文 →
2026年8月13日

万利虚拟人从一个固定形象变成长期互动角色以后,为什么"角色设定不能乱变"开始和画质一样重要?

一次性渲染的虚拟人,只需要在单次输出里保持一致;但一旦角色需要每天直播、连续陪伴用户几十天,问题就变了——画质是渲染引擎决定的,天然稳定,性格和语气却是模型每一轮实时生成出来的,天然不具备稳定性。万利虚拟人把角色一致性当作需要持续维护的系统,而不是写完就归档的人物小传:用可判断的具体规则约束语气、用轻量校验拦截明显偏离、用跨会话的角色记忆摘要防止角色因为不记得自己说过什么而前后矛盾。同一个角色如果同时出现在直播间和私聊场景,若两边各自维护一套逻辑,很容易悄悄分裂成两个人设;对话拉得越长,早期设定的权重也越容易被后续内容稀释,这类细微漂移目前仍然主要靠事后复盘和规则补丁去发现、收窄。

阅读全文 →

万利虚拟主播深度内容

2026年8月29日

万利虚拟主播能够连续工作以后,为什么真正决定直播质量的仍然是它遇到陌生问题时会怎么回答?

万利虚拟主播能不能连续直播不是关键,真正考验它的,是弹幕突然抛来一句脚本里完全没有的提问。这背后需要意图识别判断这句话到底在问什么、知识检索找到准确依据、语气人设保持前后一致三件事同时发生,遇到医疗建议、投资承诺这类问题时还要能干脆拒答。这条能力,恰恰是只会循环播放固定视频的录播型数字人完全不具备的——后者不管弹幕说什么,画面从头到尾都不会有任何反应。遇到超出预设范围或者明显恶意构造的提问,比起勉强给出一个答案,诚实地说一句"这个问题需要再确认一下",反而更能维持观众的信任,这也是知识库覆盖面之外,团队格外看重的一种应对策略,毕竟直播不会因为一句"不知道"就翻车,却很可能因为一句自信满满的错误答案而失去观众信任。

阅读全文 →
2026年8月23日

万利虚拟主播已经能读取直播脚本以后,为什么直播过程中临时修改商品信息仍然需要实时知识更新?

直播脚本在写完的那一刻就已经开始"过时"——库存会变、价格会调、优惠规则可能中途取消。万利虚拟主播如果只会照着最初的脚本念,说出的数字很容易和后台真实情况对不上,比闭口不答更容易让观众投诉。脚本回答的是"该说什么",知识库回答的是"现在事实是什么",两者更新频率完全不同,需要一套能被随时写入、随时读取的实时知识系统,配合人工兜底和开播前的双重核对,才能保证主播说的每一句话都对得上此刻的直播间。开播前团队通常会核对价格、库存、优惠规则这几个最容易出错的字段是否和后台一致,开播后一旦数值出现异常,也会先暂停这部分自动回答、转人工确认,双重把关比单纯依赖系统判断稳妥得多。

阅读全文 →
2026年8月17日

万利虚拟主播做数字人主持时,为什么主持一场提前写好流程的发布会和主持开放式直播间其实是两种完全不同的AI任务?

主持一场提前写好流程的发布会,和主持一间随时可能被弹幕带偏话题的直播间,看起来都是"一个数字人在说话",实际考验的是两套完全不同的能力。前者更像照谱演奏,核心是精确复现流程、卡准时间点、按预案应对意外;后者更像即兴对话,核心是实时理解陌生输入、当场判断怎么接。万利虚拟主播在两类项目里,准备重点完全不同——一个花力气打磨流程稿和应急预案,一个花力气扩大知识库覆盖面和边界问题的处理策略。两者底层用到的语音合成、口型驱动、形象渲染其实相差不大,真正拉开差距的是上层任务设计——直接照搬同一套准备工作去应对另一种场景,很容易在关键时刻露出破绽,比如把发布会的固定话术直接搬进直播间,遇到追问就会显得生硬。

阅读全文 →

万利娱乐深度内容

2026年8月26日

万利娱乐里的虚拟偶像为什么不能只靠一张好看的角色设计,而必须长期保持自己的声音、性格和世界观?

一张好看的角色设计图,几轮修改基本就能定下来,这是虚拟偶像最容易过关的一步。真正难的是接下来的事:这张脸背后的角色,明天还要不要是同一个人。万利娱乐认为虚拟偶像至少要在声音、性格、世界观三条线上长期保持一致,而模型本身并不天然记得自己说过什么、承诺过什么,如果没有持续维护的角色设定库和对话历史去约束生成,很容易在长期运营中出现细微漂移,直到粉丝先一步发现不对劲。举例来说,如果虚拟偶像今天说自己最喜欢安静的咖啡店,下次却说最爱去人多的夜市,粉丝把两条内容放在一起对比,立刻就能发现破绽,长期运营需要有一份不断累积、可以被检索的互动记录,让新的回应始终能对照过去说过的话。

阅读全文 →
2026年8月20日

万利娱乐使用AI歌手以后,为什么"唱得准"仍然不能等于一段真正有角色表现力的演唱?

音准对不对,是AI歌手最容易做好、也最先被解决掉的部分;真正决定一段演唱好不好听的,是情绪起伏、换气位置、咬字松紧这些不太容易量化的细节。万利娱乐还特别强调厘清四个经常被混淆的概念——AI生成歌曲、AI生成歌声、虚拟歌手、AI明星,层层递进却不是同一件事,声音只是最外层的东西,没有稳定的角色身份,再准的演唱也只是一段孤立内容。声音的采集与使用始终建立在授权基础上,不用于复刻真实歌手。同一句歌词,温柔地唱和决绝地唱,音符完全一样,听感却天差地别,这些差异藏在时值处理、气声比例、语气重音这些不太容易量化的地方,也是目前依然需要大量人工介入调整、难以一次生成就完全到位的部分。

阅读全文 →
2026年8月12日

万利娱乐中的AI演员已经可以生成单独表演镜头以后,为什么长剧情最容易暴露它到底有没有真正理解角色?

单独看一个AI演员的表演镜头,效果常常令人惊讶;但连成一段剧情,问题很快暴露——上一场哭得撕心裂肺,下一场却像什么都没发生。万利娱乐发现,单镜头质量高和角色理解到位是两件难度完全不对等的事:前者只需匹配台词和情绪标签,后者要求角色记得上一场的情绪状态、维持与其他角色的关系分寸,让转变有迹可循。目前更现实的做法,是把AI演员用在设定清晰、结构不过分复杂的场景,并配合人工核对连贯性。可以设想一部短剧里,角色因为一次误会疏远朋友,中间几集逐渐察觉错怪对方,到后期才鼓起勇气道歉——这种转变需要贯穿多场戏层层递进,如果每场戏都孤立生成,道歉那场演得再情真意切,也会因为缺少铺垫而显得莫名其妙。

阅读全文 →

万利AI陪伴深度内容

2026年8月28日

万利AI陪伴第一次聊天已经非常自然以后,为什么真正的产品测试应该从第30天而不是第1天开始?

第一次和万利AI陪伴聊天几乎不会出问题,这种顺畅很大程度上来自模型通用的语气模仿能力,跟系统是否真正记住"这个具体的人"关系不大。真正的考验在第三十天前后:角色能不能把用户零散提过的偏好、忌讳、没说完的事,在合适的时机自然带回对话里,而不是每次都像初次见面。用户很少在第一天就流失,真正的流失往往发生在角色突然"不像自己"的那一次对话,而这种偏差通常要用满一个月才能观察到。这种"很懂我"的感觉,很大程度上来自语言模型本身在语气模仿上的通用能力,跟系统是否真正记住"这个具体的人"关系不大,把第一印象当成长期关系的证据,是最常见的判断错误,也是不少陪伴类产品短期评分高、长期留存却经不起推敲的原因。

阅读全文 →
2026年8月22日

万利AI陪伴记住用户喜欢什么以后,为什么记忆之间互相矛盾会比完全不记得更加奇怪?

用户对"忘记"的容忍度,其实比对"记错"高得多——角色坦白不记得,用户顶多遗憾;但如果角色说出两个互相矛盾的记忆,用户第一反应是"这个角色到底靠不靠谱"。万利AI陪伴认为,单纯扩大记忆容量并不能解决问题,反而会放大出现矛盾的概率,真正需要投入的是给记忆打上时间标记、遇到不确定信息时用试探性语气确认、对明显冲突的内容建立取舍逻辑,而不是把新旧信息一并保留、随机说出口。举个例子,如果用户提过养了一只猫,后来又说猫已经不在了,角色某天却随口问起"猫最近好不好",这种前后不一致带来的伤害,往往比单纯忘记更大,因为它传递出一个信号:角色不是没听到,而是听到了却没能正确处理。

阅读全文 →
2026年8月16日

万利AI陪伴怎样保持一个虚拟明星长期不"性格漂移",为什么Persona需要像软件版本一样被管理?

第一天沉稳内敛,第三天突然活泼爱开玩笑,第十天连背景故事都变了样——这不是角色在"成长",业内把这种没有设计意图的偏移称为Persona漂移,需要和被提前设计好的角色发展严格区分开。万利AI陪伴认为,管理虚拟明星的人格需要像管理软件版本一样:核心设定写成可追溯的基线文档,每次调整都是一次留痕、可回滚的更新,而不是任由角色在长期对话里被最近几轮话题悄悄带偏方向。这里最容易被混淆的是把Persona漂移和角色的正常成长混为一谈——后者是被设计出来、朝着预设方向发生的变化,核心性格和边界始终一致;前者没有方向,也没有设计意图,今天变活泼可能只是因为上一轮话题恰好比较轻松,跟角色成长毫无关系。

阅读全文 →

万利数字分身深度内容

2026年8月24日

万利数字分身已经和本人长得很像以后,为什么一开口说话仍然可能马上让熟人发现"这不是本人"?

数字分身的外貌相似度和语言相似度,是两套完全不同量级的技术——前者可以被摄像头和算法直接测量,后者藏在用词习惯、句子节奏、口头禅和场合切换这些依赖长期观察的细节里。万利数字分身发现,越是亲近、越熟悉本人说话方式的人,越容易在分身开口的瞬间察觉不对,这不是技术失败,而是提醒使用者:分身的语言还原始终有一个可感知的上限,需要持续采集真实语料才能不断推高这个上限。同一个人在对内讲话和对外答疑时,语速、用词、句子完整度其实并不相同——如果分身不区分场合,用同一套语言模型处理所有内容,哪怕每句话单独听都不算离谱,合在一起就会显得这个人"不太对",这种场合切换能力是语言相似度里最难训练的部分。

阅读全文 →
2026年8月18日

万利数字分身复制声音以后,为什么声音相似度仍然不能代替本人授权?

声音克隆本质上是对一段音频样本的统计建模,模型并不关心这段声音是不是本人主动提供、是不是本人知情,这意味着相似度的高低完全可以在本人毫不知情的情况下达到很高水平。万利数字分身把"是否本人授权"当作和技术效果同等重要、甚至排在效果之前的审核标准,明确同意、限定范围、可以撤回、来源可追溯,这四项共同构成授权型数字分身的基础,声音像不像,从来不能替代这份授权关系。这也解释了为什么不少机构在评估数字分身供应商时,会把"是否要求本人授权文件"当作第一道筛选标准,而不是先看效果样片好不好——如果一个平台在没有任何授权证明的情况下就能生成某个人的声音,任何人的声音理论上都可能被冒用。

阅读全文 →
2026年8月11日

万利数字分身被用于不同场景以后,为什么同一个数字身份可能需要分别管理主持、客服、娱乐和私人分身权限?

"一次授权、到处使用"是很多人对数字分身的默认想象,但万利数字分身发现,企业主持、客服问答、娱乐内容、私人陪伴这几种场景对"能说什么、能做什么"的要求完全不同,共用一套权限很容易出现公开场合太随意、或私人场景太受限的问题。同一张脸、同一个声音背后,其实需要拆分成几个边界清晰、可以单独授权和撤回的权限单元,一旦某个场景出问题,能快速定位、独立关闭,而不影响其他场景的正常运行。举例来说,同一个人的分身如果被授权用作品牌发布会主持,同时又单独授权做仅供家人使用的私人陪伴分身,这两个实例即便共享同一套基础模型,训练数据、可调用话题、内容能否被保存转发都应该完全独立设置,不能混用一套规则。

阅读全文 →

万利App深度内容

万利App产品功能与实时角色系统关系图
人格、记忆、语音、表情共同构成实时角色系统,同时支撑虚拟主播、AI陪伴、数字分身与虚拟偶像四个功能
2026年8月30日

万利App打开一个AI虚拟角色以后,为什么第一件需要加载的不只是人物外貌,而是它到底是谁?

用户点开万利App里的一张虚拟角色卡片,头像和口型几乎瞬间就位,但真正决定这次对话能不能成立的,是后台有没有先把这个角色的人设——它是谁、语气如何、边界在哪——完整注入对话上下文。万利app把这一步称为角色的冷启动,人设信息和对话历史其实在抢占同一块有限空间,一旦人设被排到靠后位置或者被截断,角色说着说着就会"飘"回通用助手的语气,用户能感知到不对劲,却说不清具体哪里变了。人设信息一旦被排到上下文靠后的位置或者被截断,模型宁可用训练数据里默认的通用语气去回答,听起来礼貌却没有性格,这就是常说的角色失真——用户往往说不出"上下文优先级"这种词,只会说这个角色今天怎么怪怪的。

阅读全文 →
2026年8月25日

万利App和AI角色连续聊天以后,为什么用户最容易感受到的问题不是模型参数,而是"它怎么把昨天的事情忘了"?

万利App后台收到最多的反馈,不是模型不够聪明,而是"它昨天还记得,今天怎么就忘了"。模型能力和用户感知到的记性,其实是两回事——评测集能给推理和知识面打分,却没法衡量角色记不记得用户随口提过的一件小事。真正解决问题的,不是换一个更强的底层模型,而是一套独立的记忆系统:判断哪些信息值得存、检索时能不能准确匹配上当前话题,任何一环出错,用户看到的都只是简单一句"忘了"。信息抽取时可能判断错重要性,把用户随口一提的小事当成噪音丢掉;就算存对了,检索环节如果没能准确匹配当前话题,记忆条目存在数据库里也调不出来——用户看到的结果都一样,背后原因却可能完全不同——这也是万利App把记忆当作一套需要长期迭代的独立能力、而不是模型升级附带效果去维护的原因。

阅读全文 →
2026年8月19日

万利App把虚拟主播、AI陪伴、数字分身和虚拟偶像放进同一套产品以后,为什么真正共同的底层能力其实是实时角色系统?

虚拟主播、AI陪伴、数字分身、虚拟偶像,在万利App里是四个入口不同、视觉风格各异的功能,但拆开看,底层调用的其实是同一套实时角色系统——身份设定、记忆、语音、表情动作和实时响应调度。四个场景对角色系统的要求,本质上是同一类问题的不同变体:直播要求毫秒级不崩人设,陪伴要求几个月周期记忆一致,分身要求语气贴合本人。做成统一底层后,新功能只需换一层前端展示,而不必重新解决一遍身份注入和记忆存取。虚拟主播要求角色在毫秒级互动里不崩人设,AI陪伴要求几个月周期记忆保持一致,数字分身要求语气贴合本人既有资料,虚拟偶像要求人设在唱跳、聊天、直播之间共享同一套人格——四个场景本质上是同一类问题的不同变体。

阅读全文 →

关于万利的常见问题

万利官网围绕虚拟人AI大模型、AI明星陪伴、万利虚拟主播、数字人主持、虚拟偶像、AI歌手、AI演员、数字分身与AI角色互动,提供技术介绍、产品说明与万利App使用指南,帮助用户理解这套实时角色系统是如何工作的,同时说明原创虚拟角色与授权数字分身之间的边界。

万利平台是支撑万利各类虚拟人产品的底层技术体系,整合语音识别、语言理解、记忆、人格、表情与动作驱动等模块,让虚拟角色能够实时听懂、实时思考、实时回应,而不只是播放预先做好的画面,这也是万利平台区别于普通数字人展示工具的核心所在。

普通聊天机器人只输出文字或语音,万利虚拟人还多了"被看见"这一层——用户看到的是一张脸、一双眼睛、一组动作,系统需要同时保证语音、表情、动作在内容和情绪上互相一致,而不仅仅是能对话,这也是万利虚拟人产品打磨的重点方向。

可以。万利虚拟主播的核心能力就是实时理解弹幕提问、检索相关知识、生成回应并同步驱动语音和表情,而不是循环播放固定录制好的视频内容,这也是它和录播型数字人最本质的区别,能不能实时接住陌生问题,比连续直播多少小时更能说明主播质量。

数字人主持更偏向发布会、企业活动这类提前规划好完整流程的场景,考验精确复现与应急处理;虚拟主播面对的是完全开放的直播间,考验实时理解陌生输入和临场应变,两者底层技术接近,但任务性质不同。

陪伴关系的价值大多体现在长期互动里,第一次对话顺畅只能说明基本语言能力过关,真正让用户感觉被理解的,是角色能否记住之前提过的偏好和经历,并在合适的时机自然带回对话中,这种长期一致的体验,比第一次对话是否惊艳更重要。

AI歌手更聚焦声音与演唱表现力本身;虚拟偶像则是一个拥有固定视觉身份、音乐方向、故事设定和粉丝互动的完整角色,AI歌手可以是虚拟偶像能力的一部分,但两者不能划等号——一首好听的AI歌曲,不等于一个可以长期运营的角色。

目前AI演员更适合承担短镜头、广告片段等情绪状态相对独立的内容,在情绪跨场景延续、复杂人物关系处理等方面仍有明显边界,现阶段更适合作为内容生产的补充手段,而非完全替代,尤其是需要长时间跨场次保持情绪连贯的长剧情内容。

换脸只处理某一帧画面的视觉相似度;数字分身需要同时保证外貌、声音、语言风格和知识背景的一致,并且必须建立在本人明确授权的基础上,未经授权的模仿不属于万利数字分身的应用范围。

Lip Sync指口型同步技术,即让虚拟人嘴部形状与语音内容实时匹配,技术上先把语音拆解为音素,再映射为对应口型,但准确的口型同步只是自然表演的基础,还需要配合表情、眼神和肢体动作,才能让角色显得像在表演而不是在念稿。

当虚拟人接近真人写实度时,用户会不自觉地用真人标准去评判它,眼神、表情或动作上的微小不自然反而更容易被察觉,这种"越像真人、瑕疵越显眼"的现象通常被称为恐怖谷,这也是不少虚拟人产品主动选择风格化设计的原因之一。

万利App的具体获取渠道以万利官方发布信息为准,请通过正式官方渠道获取应用,注意甄别官网之外的来源,避免下载非官方版本或所谓"破解版"造成安全风险,万利不提供也不认可任何形式的破解版本。

上海万利娱乐ai软件公司

上海万利娱乐ai软件公司是万利品牌的运营主体,专注于虚拟人AI大模型、数字人交互与AI角色互动相关的技术与产品建设。公司围绕万利平台这一底层技术体系,陆续搭建了万利虚拟人、万利虚拟主播、万利娱乐、万利AI陪伴、万利数字分身等产品线,并通过万利App将这些能力整合到同一套实时角色系统中,向个人用户和企业客户提供虚拟主持、AI陪伴、数字分身、虚拟偶像与AI角色互动等服务。

在产品方向上,公司坚持原创虚拟角色与授权数字分身两条路径并行:一部分产品基于完全原创的虚构人物设定展开,用于虚拟偶像、AI歌手、AI角色互动等娱乐场景,所有原创角色均不对应任何真实存在的人物;另一部分面向企业与个人创作者,提供建立在本人明确授权基础上的数字分身服务,用于企业主持、品牌代言、教育培训等场景,并配套授权范围界定与撤回机制。无论哪一类产品,公司都将身份透明和授权合规,作为虚拟人技术能够被长期信任、长期使用的基础,而不是可以为了追求效果或效率而绕开的环节。公司在虚拟人交互体验、长期记忆与角色一致性等方向持续投入技术打磨,并将相关的产品思考陆续整理发布在万利官网上,供关注虚拟人技术的用户、合作方与行业人士参考。万利官网发布的技术内容以说明产品设计思路为主,不代表对具体性能指标的承诺,具体功能与体验请以万利App实际提供为准。

公司名称
上海万利娱乐ai软件公司
品牌
万利 WANLI
备案号
沪ICP备20220642431号-1
核心方向
虚拟人AI大模型 · AI角色互动
AI虚拟人身份与内容说明:万利网站中出现的虚拟主持人、虚拟歌手、AI角色等均为原创设计的虚构人物,不代表任何真实存在的人物。数字分身类应用严格建立在本人明确授权的基础上,万利不提供也不支持未经授权的真人模仿、声音克隆或身份冒充相关的技术与服务。