1.1 任务介绍

        本任务介绍如何在PC环境下实现人与机器人的对话聊天,通过PC端采集文字问题信息,并将文本通过API传输到MiniMax大模型进行识别,识别成功以后,将大模型反馈的文字信息合成为语音信息,通过电脑进行语音播报。整个实现流程如下图所示:

1.2 知识储备

1.2.1 minimax大模型介绍

        MiniMax(稀宇科技)是中国领先的自研全模态大模型公司,由北京稀宇科技有限公司打造,专注通用人工智能(AGI)底层技术研发,以全模态融合、原生 Agent 能力、极致低成本为核心特色,在代码生成、智能体执行、多模态创作领域表现突出,具体情况介绍如下:

(1)MiniMax 公司概况

        MiniMax 主体为北京稀宇科技有限公司,2022 年初成立,总部位于北京,创始团队由前商汤科技高管闫俊杰博士领衔,核心成员来自谷歌、微软、商汤等国际科技企业,深耕多模态大模型与 Agent 技术底层创新。公司使命为 “与所有人共创智能”,核心聚焦全模态融合与原生 Agent 技术突破,成立两年内完成多轮融资,成为国产 AI 领域独角兽企业。2024 年通过中国《生成式人工智能服务管理暂行办法》备案,构建全球化算力集群,为技术落地奠定基础。截至 2025 年底,公司服务全球 200 多个国家及地区的超 2.36 亿名用户,企业客户及开发者超 21.4 万家,海外收入占比达 73%,全球化布局成效显著。

(2)MiniMax 大模型体系

        MiniMax 大模型是公司核心技术产品,2023 年推出首代基础模型,历经多轮迭代,形成完整全模态模型家族,技术水平达国际领先,代码与 Agent 能力全球顶尖。核心模型系列如下:

        ●基础模型(M 系列):2024 年发布 abab6.5,支持 20 万汉字上下文;2025 年推出 M1 推理模型,支持 100 万 Token 超长上下文;2026 年 2 月发布 M2.5(2300 亿总参数、100 亿激活参数),采用 MoE 架构,主打原生 Agent 生产级能力;2026 年 3 月推出 M2.7(Agent 旗舰模型),新增 Agent Harness 自我进化框架,代码能力追平 GPT-5.3-Codex;全系支持超长上下文,无损处理长文档与复杂任务。

        ●垂类专用模型:覆盖代码、视频、语音、办公等领域,包括 MiniMax-Coder(代码生成,多语言支持与工程级调试)、Hailuo(海螺视频,文生视频 / 图生视频,支持高清渲染)、MiniMax-Audio(语音合成 / 声音克隆,超拟人音色)、MiniMax-Workspace(办公自动化,复杂 Excel/Word/PPT 全流程处理),满足专业场景深度需求。

        ●推理模型(Researcher 系列):2025 年推出 MiniMax-Researcher,主打深度推理与复杂任务拆解,支持多轮工具调用、跨模态数据比对、结构化报告生成,在代码生成、办公自动化基准测试中对标国际顶尖模型。

        MiniMax 的核心技术优势显著:自研MoE 稀疏架构,推理成本降低 90%,速度提升至 100TPS;Lightning Attention 闪电注意力突破长文本处理瓶颈,支持百万级 Token 上下文;Agent Harness 框架实现模型自我进化,可承担研发流程 30%-50% 工作量;软硬件协同优化,适配多主流芯片平台,推理性能达 GPT-5.5 的 1.37 倍。

(3)MiniMax 产品与服务生态

        MiniMax 构建 “模型 + 平台 + 应用” 全栈生态,C 端体验与 B 端落地双轮驱动,核心产品与服务如下:

        ●C 端智能应用:官网与 App 提供对话交互,支持快速 / 思考 / 联网搜索模式切换;核心产品包括海螺 AI(视频生成,零门槛创作)、星野 / Talkie(情感陪聊,虚拟角色互动,月活超 2000 万)、MiniMax Audio(语音创作,声音克隆与 AI 配音),适配内容创作、社交互动、娱乐休闲等场景,以全模态生成与高交互体验为特色。

        ●B 端 API 服务:提供兼容 OpenAI 格式的 API 接口,支持 M2.5/M2.7/Researcher 等模型调用;新用户注册赠送免费额度,含永久免费模型 minimax-m2.7-free,足够个人长期使用;定价极致普惠,M2.5 模型 API 价格为海外头部模型的 1/10-1/20,支持 JSON 输出、工具调用、智能体开发,适配企业私有化部署与二次开发。

        ●开源生态:M2.5/M2.7 核心模型开源,免费开放权重与代码,支持本地部署、二次开发与商业化,降低 AI 应用门槛,推动全模态技术普惠。

        ●行业解决方案:覆盖金融、法律、办公、内容创作等领域,提供定制化智能合同审查、办公自动化、视频内容生成、企业知识库构建等服务,助力企业低成本实现 AI 转型。

(4)MiniMax 的核心优势与定位

        MiniMax 定位为 “全模态融合、原生 Agent 执行、开源普惠低成本” 的通用大模型服务商,核心优势体现在三方面:

        ●全模态能力全球领先:原生支持文本、图像、音频、视频、音乐多模态理解与生成,海螺视频、星野等产品落地成熟,多模态创作能力行业第一。

        ●代码与 Agent 能力突出:M2.7 代码能力追平国际顶尖模型,Agent Harness 框架支持复杂任务自主拆解与执行,办公自动化、工程级代码生成场景表现优异。

        ●极致低成本且普惠开源:MoE 架构大幅降低推理成本,API 定价亲民,免费额度充足;核心模型开源免费商用,个人与中小企业零门槛使用。

        与 Kimi 侧重超长文本处理、DeepSeek 侧重底层推理不同,MiniMax 更聚焦全模态融合、原生 Agent 执行与低成本规模化,适合内容创作、办公自动化、情感交互、复杂工程任务等场景,与 Kimi、DeepSeek 形成差异化互补,共同推动国产 AI 技术创新与产业落地。

1.2.2 相关第三方库

(1)Python requests库

        Python requests 是一个常用的 HTTP 请求库,可以方便地向网站发送 HTTP 请求,并获取响应结果。requests模块比urllib模块更简洁。

        使用 requests 发送HTTP 请求需要先导入 requests 模块:

import requests

        导入后就可以发送HTTP请求,使用requests提供的方法向指定URL发送 HTTP 请求,例如:

# 导入 requests 包
import requests

# 发送请求
x = requests.get('https://www.runoob.com/')

# 返回网页内容
print(x.text)

每次调用 requests 请求之后,会返回一个 response 对象,该对象包含了具体的响应信息,如状态码、响应头、响应内容等:

print(response.status_code)  # 获取响应状态码
print(response.headers)  # 获取响应头
print(response.content)  # 获取响应内容

        附加请求参数

发送请求我们可以在请求中附加额外的参数,例如请求头、查询参数、请求体等,例如:

headers = {'User-Agent': 'Mozilla/5.0'}  # 设置请求头
params = {'key1': 'value1', 'key2': 'value2'}  # 设置查询参数
data = {'username': 'example', 'password': '123456'}  # 设置请求体
response = requests.post('https://www.runoob.com', headers=headers, params=params, data=data)

(2)Python pywin32库

        pywin32 是 Windows 专属的 Python 扩展库,作用是让 Python 能直接调用 Windows 原生 API 与 COM 组件,实现系统控制、Office 自动化、窗口 / 键鼠模拟、服务 / 注册表管理等深度操作。使用前需要先安装pywin32模块:

pip install pywin32

安装完成后,你的代码import win32com.client就可以正常使用了。

import win32com.client #Windows自带语音库
# 创建语音播报对象(使用Windows自带的SAPI语音)
speaker = win32com.client.Dispatch("SAPI.SpVoice") 
# 播报文字
speaker.Speak("你好,这是Windows自带的语音播报")

1.3 任务要求

1.能够注册和登录MiniMax。

2.能够创建并获取MiniMax API key。

3.能够撰写前端代码和MiniMax大模型进行交互。

4.能够理解数据链路:将输入的文本传送给MiniMax大模型->MiniMax大模型反馈的文本进行流式输出->同时将输出的流式文本解析并合成为音频进行播报。

1.4 任务准备

•Vmware虚拟机

•电脑(Windows 10)

•minimax云账号

1.5 任务实施

1.5.1 注册并登录minimax

登录网址如下:

概览 - MiniMax 开放平台文档中心MiniMax 模型体系涵盖语言、视频、语音、图像与音乐五大方向,助力开发者高效构建智能应用。https://platform.minimaxi.com/

通过手机号进行注册和登录。

        登录进去以后,能看到MiniMax模型体系涵盖文本、语音、视频、图像与音乐五大方向,如下图所示界面:

在如下网站中找到【API Key管理】

MiniMax API 开放平台日均处理超万亿Token请求,累计服务超10万开发者https://platform.minimaxi.com/user-center/basic-information/interface-key

更多MiniMax的API描述请查看网址如下:

接口概览 - MiniMax 开放平台文档中心MiniMax 开放平台 API 接口能力概览,包括语言、视频、语音、图像、音乐和文件管理等多模态能力。https://platform.minimaxi.com/docs/api-reference/api-overview

1.5.2 创建并获取API key

点击新建【API Key】,如下图所示:

点击【创建密钥】,如下图所示:

API key只显示一次请注意保存,本任务的API key为:

sk-api-lhaJaEsGc3z8pWK0c44wSYiLDl-pWRHdsVZAsV96Tc6SeFyS7ZIewEUitBa3rEhAuYlC53Dnbbe4TFur7ob3dcq41naMyAbUIcCn-vOoExoDVcJVLY_dkX8

创建成功后,生成的这个MiniMax API Key在后面的代码中会使用到。

需要进行实名认证才能充值。认证以后获得了15元的代金券。

可用的文本模型有以下:

1.5.3 任务测试

        在Jupyter中输入以下代码,命名为talk_to_minimax_llm,意思是跟大语言模型进行聊天。注意,要将API_KEY,MODEL_NAME,API_URL赋值到python测试程序中。

        请求代码示例:

# -*- coding: utf-8 -*-
# 导入所需库
import win32com.client  # Windows 自带语音库
import requests         # 发送网络请求
import json             # 处理 JSON 数据格式

# ======================================================
# 配置区:改成你的 MiniMax 信息
# ======================================================
MINIMAX_API_KEY = "sk-api-lhaJaEsGc3z8pWK0c44wSYiLDl-pWRHdsVZAsV96Tc6SeFyS7ZIewEUitBa3rEhAuYlC53Dnbbe4TFur7ob3dcq41naMyAbUIcCn-vOoExoDVcJVLY_dkX8"
MODEL_NAME = "MiniMax-M2"   # 选择一个模型来使用
API_URL = "https://api.minimaxi.com/v1/chat/completions"

# ======================================================
# 初始化语音引擎(Windows 自带 SAPI,稳定)
# ======================================================
speaker = win32com.client.Dispatch("SAPI.SpVoice")

def speak(text):
    """让电脑朗读一段文字"""
    speaker.Speak(text)

def chat_with_minimax(history):
    """调用 MiniMax API,返回回复文字"""
    headers = {
        "Authorization": f"Bearer {MINIMAX_API_KEY}",
        "Content-Type": "application/json; charset=utf-8"
    }

    payload = json.dumps({
        "model": MODEL_NAME,
        "messages": history,
        "temperature": 0.7,
        "max_tokens": 1024
    }, ensure_ascii=False).encode("utf-8")

    try:
        resp = requests.post(API_URL, headers=headers, data=payload, timeout=30)
        js = resp.json()

        if "error" in js:
            return f"服务器错误:{js['error']['message']}"

        contents = js["choices"][0]["message"].get("content", "")
        return contents.strip() or "没有获取到回复"

    except Exception as e:
        return f"请求失败:{str(e)}"

def ask(your_name, ai_name, history):
    q = input(f"\n{your_name}:").strip()
    if q == "0":
        return False

    speak(q)
    history.append({"role": "user", "content": q})

    print("(正在思考中...)")
    ans = chat_with_minimax(history)

    print(f"\n{ai_name}:{ans}")
    speak(ans)

    history.append({"role": "assistant", "content": ans})
    return True

def main():
    print("=" * 40)
    print("    欢迎使用 MiniMax 智能聊天室")
    print("=" * 40)

    your_name = input("请问你的名字:").strip() or "我"
    ai_name = input("请给 AI 取个名字:").strip() or "MiniMax"

    history = [
        {"role": "system", "content": "你是一个聊天助手,回答要简洁,问什么答什么,就像聊天一样,不要做多余介绍,不要用编号列表。"}
    ]

    print(f"\n{ai_name}:你好,{your_name}!输入 0 退出。")
    speak(f"你好,{your_name}")
    print("-" * 40)

    while True:
        if not ask(your_name, ai_name, history):
            print(f"\n{ai_name}:再见,{your_name}!")
            speak(f"再见,{your_name}")
            break

if __name__ == "__main__":
    main()

        实验现象如下:

        输入你是的聊天名字,比如“vincent”,AI的聊天名字,取名“ai”。接着进行提问,

例如,问题一:明朝第一个皇帝是谁?问题二:上海朋友结婚,一般随礼给多少钱?

这些问题都会上传给MiniMax大模型来回答,最后返回的文字结果进行显示和语音播报,如下:

视频如下:

和MiniMax大模型聊天测试

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐